{"as_of":"2026-08-20T05:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdee84fff37e0dd76703899deef4985deea91d53498e635e91b55e9f38d27e28","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:46:50.980711Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:07:10.581791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.759572Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-08-06T14:07:10.581791Z","title":"On-policy rl with optimal reward baseline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19766","last_updated":"2025-07-26T03:42:33Z","snapshot_observed_at":"2026-08-15T23:25:22.033274Z","submitted_at":"2025-07-26T03:42:33Z","title":"UloRL:An Ultra-Long Output Reinforcement Learning Approach for Advancing Large Language Models' Reasoning Abilities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:07:10.581791Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2507.19766"},"observation_digest":"sha256:f5f3c892c0b29aa24e7595c3770970583323c682be64ce6ec1f36ee9665fa5de","observation_id":"2734aa74-a458-4f4d-93c9-0945d4426584","resolution":{"observed_at":"2026-08-06T14:07:10.581791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-08-16T12:08:41.734241Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T07:37:12.501489Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2510.10150"},"observation_digest":"sha256:707ff1918280c4d16eddca84094b6a41247210163e55a375b4c1500aba372d50","observation_id":"8793b3f4-1be9-4745-a4f2-e769ce5826b0","resolution":{"observed_at":"2026-05-18T07:41:03.216079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2604.00860","last_updated":"2026-07-07T13:24:35Z","snapshot_observed_at":"2026-08-19T19:49:53.621281Z","submitted_at":"2026-04-01T13:10:20Z","title":"Policy Improvement Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T22:47:05.132020Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2604.00860"},"observation_digest":"sha256:d71ed189f280dc4fa2f2768322b25f12529a7035087dc645a70bb12033cd5ff6","observation_id":"9db8ea4c-ef83-401e-a53e-06dc3fb98d35","resolution":{"observed_at":"2026-05-13T22:48:22.858481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T07:00:32.206081Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:c92baca530def236771ecbf6715924a538aa05568b9f493ab37c71482627e0cf","observation_id":"0d264321-b1b6-4599-8e4a-c783024c61a8","resolution":{"observed_at":"2026-05-12T10:16:27.278990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T23:47:53.282259Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:efe4eb95d84892889e6091da31ddf7e2d55aa6bc4b01c2f825094698db161fac","observation_id":"752d6683-b8cb-479f-b559-908239a3875c","resolution":{"observed_at":"2026-05-20T23:49:14.929225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2605.05965","last_updated":"2026-05-07T10:11:51Z","snapshot_observed_at":"2026-08-13T12:51:35.018968Z","submitted_at":"2026-05-07T10:11:51Z","title":"Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:54.001327Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2605.05965"},"observation_digest":"sha256:f7c12c54e0d3878e6ed069b362384dca8582ed781a9c2b9344afd3cfc40968dd","observation_id":"32df8d68-545c-4bb8-aee5-2a2c4803d5fa","resolution":{"observed_at":"2026-05-11T16:36:10.479798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:8e1c8639ec3537a97a3c243c8e93b86c151035f6fd0a932745ad071a4bb5e5ff","observation_id":"bb1413e4-7d89-463c-8777-db47a92cb050","resolution":{"observed_at":"2026-05-13T01:42:02.898305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:c4daaf9e1ae3ace6e5b54d16dfae04d01af586a0b87f7b79f80a6052ce324c8b","observation_id":"65121ee2-c018-4af9-8868-4743fd40aca8","resolution":{"observed_at":"2026-05-13T06:12:22.799052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:2b3bd2f253b4ab2faa63ee15f2ac1d9ed069d11c9cc6419c9ede3f40652f6167","observation_id":"6d678c24-3e73-4b0a-95e6-a526d8b673f7","resolution":{"observed_at":"2026-05-22T10:01:23.127974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2606.12634","last_updated":"2026-07-13T19:37:25Z","snapshot_observed_at":"2026-08-13T06:18:01.735522Z","submitted_at":"2026-06-10T19:53:20Z","title":"Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:29.586968Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2606.12634"},"observation_digest":"sha256:481940b9c597a3f99c7c0d36dbf57baa93ed248968a4af10b6cade957b08cf61","observation_id":"7d1f1c99-71d2-4524-900f-75fea0fce1c7","resolution":{"observed_at":"2026-07-03T09:07:48.294529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2606.12634","last_updated":"2026-07-13T19:37:25Z","snapshot_observed_at":"2026-08-13T06:18:01.735522Z","submitted_at":"2026-06-10T19:53:20Z","title":"Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T07:48:15.475103Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2606.12634"},"observation_digest":"sha256:02e89009939a24b2e64ef71a578cc7ed0ccd3d90bdf5054e776cf2f02fd09792","observation_id":"7fb79ea2-5234-42bd-9488-99fc41b2e7a0","resolution":{"observed_at":"2026-07-01T07:55:31.197198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:3b2fcda74b0de258b9d02217b70c1be3502606d9d54e6354e09dfe5499164679","observation_id":"feac46a2-371a-4fc9-8797-50a800d304e6","resolution":{"observed_at":"2026-07-04T07:59:40.760859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23585/citation-record","integrity":"/paper/2505.23585/integrity","json":"/paper/2505.23585/citation-record.json","paper":"/paper/2505.23585"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:46:49.967939Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:49.967939Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:eab7fc23298e4b23fc76e588c86bd2852c881d577eb6a7e38bd1ddc65b18bece","observation_id":"2dcd3541-28e0-4613-beeb-c5457c7d466b","resolution":{"observed_at":"2026-08-07T12:46:49.967939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:51.554169Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"077126a4-f724-4300-8f61-4cfe7682f713","year":2002},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.133721Z"},"links":{"citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:5a3280a01b8f803aec7f66780ba9e52dbf181df268bbd8f4b61649950ecd60ef","observation_id":"2e642235-367e-4ce6-96e0-6e50fc2734c9","resolution":{"observed_at":"2026-08-07T12:46:51.636308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:46:50.292119Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.292119Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:bfe1b2fd2f2a9015be3206fbf4e49f2538a3b977e48947c060cbc6ce7ae39a49","observation_id":"19022d9d-dd2a-46a8-b3ea-bad1333745d1","resolution":{"observed_at":"2026-08-07T12:46:50.292119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:51.407903Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"01f5cf4f-1cd8-4967-80d7-e750fc281d80","year":2024},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.380147Z"},"links":{"citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:481d6c68990afe724ce28c86a523e06e447d5733a46d4ab7a5c51ba57f35c4dd","observation_id":"5bb3f326-21a2-4b99-bbd4-319545fc2b19","resolution":{"observed_at":"2026-08-07T12:46:51.488207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:46:50.477043Z","title":"GPT4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.477043Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:0b2ee45310ef72db98d62f3b9c9051e21064fb74c8b72589c69ecf9684e0b9da","observation_id":"d49e6d92-b1f3-46eb-8e7b-fd09ebf946af","resolution":{"observed_at":"2026-08-07T12:46:50.477043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:46:50.703608Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.703608Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:2e54ede9ab16e88108e42e705fb3fa2d1920a29ab14f57598de04110a3b7e555","observation_id":"bf99ce1d-558d-41a9-be08-e083b247bb7c","resolution":{"observed_at":"2026-08-07T12:46:50.703608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T12:46:50.798376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.798376Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:0c5d72c3cfcae9b0db3189fd12814fc59353a3d24726f73587b448ae82c3f867","observation_id":"c5fc5994-bdba-4e76-ba57-475127ed913e","resolution":{"observed_at":"2026-08-07T12:46:50.798376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T12:46:50.980711Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.980711Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:a1d2da66d98b4bf2e4f33234daed6b3b07284a9da7fd557c85ec78750597100d","observation_id":"0f4e0d30-1fee-407c-b9f1-0db0ecc45304","resolution":{"observed_at":"2026-08-07T12:46:50.980711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:51.263592Z","title":"Neural text generation with unlikelihood training","venue":null,"work_id":"954c8543-b80d-4188-94e6-6fe30250307a","year":2020},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.893301Z"},"links":{"citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:a82e4f8cc82c536465e7e0512631389a37180f73bdd36b3ed7b14bd7c83b1e3a","observation_id":"24f923a4-be90-4d91-9fbb-4fed684d2973","resolution":{"observed_at":"2026-08-07T12:46:51.316058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:46:50.635625Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.635625Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:de5988f3d450527626c1a54a0ac7a5bdaca5017e28dcbf48e521c861b33c5d01","observation_id":"c3930687-7926-4244-a3bb-9abbaa758984","resolution":{"observed_at":"2026-08-07T12:46:50.635625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:46:50.540130Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.540130Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:e80fa88eeadc9e17d03426d7fb103fa3759fc7bace3abdf0cbd6b61bc5359ee1","observation_id":"a37069ee-a91e-4bf0-8578-d051882fec5f","resolution":{"observed_at":"2026-08-07T12:46:50.540130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:46:49.833777Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:49.833777Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:dca1cbdd9bbc8cfbc99481dcf06bd3e99b7e4b3fdbd57bfbfbefd31291aa8372","observation_id":"956640e0-8b55-45e4-96bf-058de5bdc983","resolution":{"observed_at":"2026-08-07T12:46:49.833777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:49.876159Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:49.876159Z"},"links":{"citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:491a8e772c2f69bde0328330cea5258af586c85e5c0d1268c745bfa009ca79ce","observation_id":"c10971a2-1dd0-4e53-b562-bd4a54572573","resolution":{"observed_at":"2026-08-07T12:46:49.876159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T12:46:50.225237Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.225237Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:89131b206107b9c22b45f9a03e366f43c5e4784a5d0f72432178babcbf80c730","observation_id":"afc7fb7b-9b0f-46ce-9d99-f4240d1b0608","resolution":{"observed_at":"2026-08-07T12:46:50.225237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T12:46:50.044130Z","title":"[Hu25] Jian Hu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:50.044130Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.23585"},"observation_digest":"sha256:5da237a286f18bb2ce80e8b0a8321e1ad970eb6d964cf1858c068a89b3ae77ae","observation_id":"370b104d-8aa6-45cb-a7fc-fc06aed6c4b3","resolution":{"observed_at":"2026-08-07T12:46:50.044130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T01:10:57.900674Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 12 inbound Pith citation observations for arXiv:2505.23585."}