{"as_of":"2026-08-19T01:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f02dba8437696107e2a78607aacb3d55405cfc8380d64588ea3ecfe8778f2a3c","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:29.701438Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:57:26.363737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-04T07:57:26.363737Z","title":"Dcpo: Dynamic clipping policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-08-17T00:50:39.033943Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T07:57:26.363737Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2510.23497"},"observation_digest":"sha256:af459538aa74a871733802736a59783eda00208a233e0a8125ebfd087632a808","observation_id":"959b34f9-ed7b-458b-b93e-ebb4e6625e74","resolution":{"observed_at":"2026-08-04T07:57:26.363737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2511.04256","last_updated":"2026-04-10T17:03:55Z","snapshot_observed_at":"2026-08-14T19:18:21.561123Z","submitted_at":"2025-11-06T10:48:31Z","title":"SSPO: Subsentence-level Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:19:45.247967Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2511.04256"},"observation_digest":"sha256:f0c9a448b520a0575a41f34107ea81274cc1f10f477ac0bfebed36a9e2a10583","observation_id":"619592de-df22-4efa-9f53-ca814126aaed","resolution":{"observed_at":"2026-05-18T01:20:34.252024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-04T06:07:01.461595Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10880","last_updated":"2026-08-03T17:34:50Z","snapshot_observed_at":"2026-08-13T11:59:21.428613Z","submitted_at":"2026-02-11T14:08:06Z","title":"Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:01.461595Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2602.10880"},"observation_digest":"sha256:8042538656e90d76078e47c1ec6dd98dc3a433e629c41221c66aefd9bff47773","observation_id":"77a4282b-d569-4f04-92b1-ad826df520c1","resolution":{"observed_at":"2026-08-04T06:07:01.461595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2604.00860","last_updated":"2026-07-07T13:24:35Z","snapshot_observed_at":"2026-08-14T21:56:42.122600Z","submitted_at":"2026-04-01T13:10:20Z","title":"Policy Improvement Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T22:47:05.132020Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2604.00860"},"observation_digest":"sha256:6660ab1837b0fe2cf84312e8bec55bed92a14650ddda69bce2232624834bf050","observation_id":"e98b6496-b2d0-4e43-ad84-d51363ff9d06","resolution":{"observed_at":"2026-05-13T22:48:22.789866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2604.13088","last_updated":"2026-05-23T02:00:24Z","snapshot_observed_at":"2026-08-11T07:50:37.511142Z","submitted_at":"2026-04-04T02:47:28Z","title":"Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T18:41:26.965577Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2604.13088"},"observation_digest":"sha256:02696bfc2e22148e087e64e28025ffecad1c7aad36615d4a0ceb456327b29534","observation_id":"e22525b4-c3cc-40b8-8ddd-17e9aa3afd86","resolution":{"observed_at":"2026-05-13T18:43:07.466439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-07-13T13:07:31.208017Z","title":"Dcpo: Dynamic clipping policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13088","last_updated":"2026-05-23T02:00:24Z","snapshot_observed_at":"2026-08-11T07:50:37.511142Z","submitted_at":"2026-04-04T02:47:28Z","title":"Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-13T13:07:31.208017Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2604.13088"},"observation_digest":"sha256:798b517dd68bdfb6995024e735ebee84341ddb2b9fb445b633529dfc3a2fca52","observation_id":"aaf16670-f46d-4f31-8aea-15efdc23cb14","resolution":{"observed_at":"2026-07-13T13:07:31.208017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2604.16972","last_updated":"2026-04-18T11:43:08Z","snapshot_observed_at":"2026-08-12T20:04:42.355033Z","submitted_at":"2026-04-18T11:43:08Z","title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T07:05:45.081955Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2604.16972"},"observation_digest":"sha256:6b864b75e33a8c0111de037c651f81e9aa474ad88ed99c021d0663636fc705b7","observation_id":"0e50610b-be2f-4a28-85eb-833774fab59a","resolution":{"observed_at":"2026-05-10T07:06:52.794873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2604.23318","last_updated":"2026-04-25T14:11:23Z","snapshot_observed_at":"2026-08-14T21:07:42.900380Z","submitted_at":"2026-04-25T14:11:23Z","title":"Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T08:05:36.206946Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2604.23318"},"observation_digest":"sha256:42dcc986f5cf2d23a6d6cf8bd1e160f6c36ba47a44765bdf0f2cd002bfdc2818","observation_id":"71fbcbc2-a948-4e15-a760-343c73547c9e","resolution":{"observed_at":"2026-05-11T20:46:12.993056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:188af7c76b37b352202a65d76b627af2b0e76a9096cf5d5f4871daba97a66a82","observation_id":"f63ea4b3-fee7-4416-9b64-cae9c7f20040","resolution":{"observed_at":"2026-05-13T01:42:02.915611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.12913","last_updated":"2026-05-13T02:40:28Z","snapshot_observed_at":"2026-08-15T04:56:36.779173Z","submitted_at":"2026-05-13T02:40:28Z","title":"Revisiting DAgger in the Era of LLM-Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:06.762156Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.12913"},"observation_digest":"sha256:1e2c0140f6eddd76bac9b23e3917bd5c707800286351a796dcda34a48dfea369","observation_id":"a6d9ae2b-fa2d-4991-95a4-32a88213f45b","resolution":{"observed_at":"2026-05-14T19:57:53.349495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-16T19:46:07.684977Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-21T06:08:55.571828Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:5fb58bc4ca06461c8510c1941487511ba10f7ed0dff30198b1c4c4744df3c71e","observation_id":"1907e884-6752-419b-ad78-3e2e61c988e7","resolution":{"observed_at":"2026-05-21T06:09:41.324572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-16T19:46:07.684977Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-30T17:15:53.286925Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:bac639ada2abe0a02acdae74fa7ad882f1671375f2eaaf99ffd0e74e88f3ee21","observation_id":"10a2d3fe-40a5-4d0e-a7dc-0966a032f248","resolution":{"observed_at":"2026-07-01T15:15:47.324889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.28388","last_updated":"2026-05-27T12:25:57Z","snapshot_observed_at":"2026-08-17T09:04:48.942711Z","submitted_at":"2026-05-27T12:25:57Z","title":"Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T12:11:00.402276Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.28388"},"observation_digest":"sha256:e0f4418530566c40a6bf1d243384e059e6fb305cea238dc2cc82b0832bec913d","observation_id":"ac7a7c67-77f7-46e8-9875-4e3aaeeb8c81","resolution":{"observed_at":"2026-06-29T12:13:26.575383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2606.08982","last_updated":"2026-06-08T03:27:05Z","snapshot_observed_at":"2026-08-03T20:51:10.860334Z","submitted_at":"2026-06-08T03:27:05Z","title":"Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:54.293859Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2606.08982"},"observation_digest":"sha256:08f20c95164b2d5c6eeb918c7fc8ee0db91b2459ca83162dff6ca928f6fb43b2","observation_id":"b91c7737-5557-43fa-bb00-d7f3f9c38e9a","resolution":{"observed_at":"2026-06-27T17:01:07.442871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T13:56:09.049753Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:0d0096caa02d48f322934b967ece4b386c20d64f021d3ea1adcc8e9c5f04875e","observation_id":"46c84091-9a12-405a-a5fa-59c35417e406","resolution":{"observed_at":"2026-07-03T04:27:36.576093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-07-12T14:27:05.589465Z","title":"DCPO: Dynamic Clipping Policy Optimization.arXiv preprint arXiv:2509.02333, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T14:27:05.589465Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:8f436f09ae120733cea8c5abca61bdf87c0544cdcc82b04db3da3ff49bed1301","observation_id":"acc6b601-86f6-4862-9b33-f954d69f85b7","resolution":{"observed_at":"2026-07-12T14:27:05.589465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2607.07178","last_updated":"2026-07-08T09:13:05Z","snapshot_observed_at":"2026-08-15T23:18:33.925712Z","submitted_at":"2026-07-08T09:13:05Z","title":"Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T18:19:12.180499Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2607.07178"},"observation_digest":"sha256:bc2c81149e2cac476a8f0fa8afd9a9c7403cdc33c58f462dafdca33bcf940ee8","observation_id":"11ddaa8c-629e-4672-85dd-f8a103c228e5","resolution":{"observed_at":"2026-07-09T18:26:26.298788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02333/citation-record","integrity":"/paper/2509.02333/integrity","json":"/paper/2509.02333/citation-record.json","paper":"/paper/2509.02333"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T11:43:28.500127Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.500127Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:07c3b4065070872d2f12b678c33c6353aeafa5d3dc36c486cee2f49290c2a2d7","observation_id":"612402b8-1257-4662-aa19-493ee8a8300c","resolution":{"observed_at":"2026-08-05T11:43:28.500127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T11:43:28.762835Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.762835Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:a5eea81aa56fa07e03c26d818d17eae8c3972616a53855b1444a145528059465","observation_id":"06950766-b439-4f42-8812-ce89b7b1a72c","resolution":{"observed_at":"2026-08-05T11:43:28.762835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T11:43:28.966325Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.966325Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:f3d3727f07017b3d4a1c3396e977dd5e8564a676d58f852b0f5bfb0c65c0c923","observation_id":"81639376-3c9f-4a41-a978-1420a4578330","resolution":{"observed_at":"2026-08-05T11:43:28.966325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-16T21:10:35.590654Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T11:43:29.052172Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.052172Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:7b1a2573223fc899e63feacb0fa934d67a4e7c885d8414d0a5376dd9e51a1932","observation_id":"4463601e-c8c2-427e-808f-e1b7ca51064d","resolution":{"observed_at":"2026-08-05T11:43:29.052172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T11:43:29.133703Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.133703Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:cb7caa01fc64b323d279c9040077df595e9fbd2067cb51440330a35ff9229f55","observation_id":"12433ec2-b841-44aa-aaf2-3a277c7b855c","resolution":{"observed_at":"2026-08-05T11:43:29.133703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T11:43:29.342020Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.342020Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:eb93dc3d7bdfc519ff5c6223918ded3dfe293b1f977d45280124cbf024d2bc1c","observation_id":"cf81ad52-1075-4fd5-81a4-a154b849fd1d","resolution":{"observed_at":"2026-08-05T11:43:29.342020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T11:43:29.437153Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.437153Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:55df462fd92a125c7d3582908514eb448afcd29b30de6e58b873adff337ec077","observation_id":"937f706c-1370-41df-be2a-827bf3bbdb27","resolution":{"observed_at":"2026-08-05T11:43:29.437153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T11:43:29.538938Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.538938Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:502cf8c84b7d48e228103587bdacda6cc32072e1cc353b48e215409776481266","observation_id":"d6ea7d39-d2b7-4c29-9ad7-5f9cbcc86825","resolution":{"observed_at":"2026-08-05T11:43:29.538938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:43:30.581505Z","title":"θParameters of the actor model","venue":null,"work_id":"b5d8dce6-a668-453b-bd29-26f25021eae0","year":2024},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.603547Z"},"links":{"citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:20e6182699546cc11e08f68a3af56b3898e48f5e0be39b019997054e499ba502","observation_id":"fafd8e02-71a0-49ac-b601-3dcc6dbe5b31","resolution":{"observed_at":"2026-08-05T11:43:30.684866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:43:30.374358Z","title":null,"venue":null,"work_id":"f8be24ff-bb91-4c6c-9afd-d6017993109b","year":2020},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.701438Z"},"links":{"citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:f3faafea9ae2fc57a17f11d159d661bf2bbf9c731cc8d14f29810adb318bf711","observation_id":"f2b6d977-e482-4e16-8d7d-b47931e50ad9","resolution":{"observed_at":"2026-08-05T11:43:30.468680Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T11:43:28.901811Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.901811Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:02f971cee089f53feb38c17ccad5c55f6461fab64a12db9966bc8feeeb729aa2","observation_id":"f2ff9d1d-6452-4efb-be0b-1dcbb29f38a6","resolution":{"observed_at":"2026-08-05T11:43:28.901811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T11:43:29.221424Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.221424Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:efacbf6fd37c3084e84ff0aa88fee3ec0aa313e1b2d808c874caf84ccf6634ba","observation_id":"9734dab3-faec-4543-8bea-8ddb9313634f","resolution":{"observed_at":"2026-08-05T11:43:29.221424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T11:43:28.827284Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.827284Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:cc8ce7f13e4216b356ffae3f7c13b778c7dafb4e7d5a2de3116326db728bffb9","observation_id":"5ae4ce3d-0029-4c60-8867-dc1e9a2f3892","resolution":{"observed_at":"2026-08-05T11:43:28.827284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T11:43:28.584291Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.584291Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:f02cb1554f5bba7637c9b86f6b1c6d286e723e93afe768e69e24b1503d1203e7","observation_id":"ade20952-dfcf-4917-a25d-374db064673f","resolution":{"observed_at":"2026-08-05T11:43:28.584291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T11:43:28.710266Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:28.710266Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:14ea4ad2a93e5f8ba8ef97af3bc1dc2bc51598ad56f9152f8f2eeab87f085aec","observation_id":"1a7e4936-c230-4a9a-9461-d3d8e254ab2b","resolution":{"observed_at":"2026-08-05T11:43:28.710266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T15:11:42.196300Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 17 inbound Pith citation observations for arXiv:2509.02333."}