{"as_of":"2026-08-11T06:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3790774d8c59d49867c11f7de52210de71b77829841dac2a2b9d29a613b2cf66","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T23:33:10.824995Z","state":"measured"},{"denominator":141,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":141,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1071,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:44:35.961914Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T03:28:57.008431Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2405.11143"},"observation_digest":"sha256:a7157ec29107e8b4fdd0e907eaa2f1891749819b69bdea3503e602d6527a4eb4","observation_id":"734e70fe-fa22-492f-b07f-a61db578ec65","resolution":{"observed_at":"2026-05-15T03:28:57.181180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:acfe23c0ffc271ffc78e2c290519b755627b48fc23c4c0161d3fc3c716bf63e6","observation_id":"5ba38af3-159d-467c-9c25-3b7f99c5bbf9","resolution":{"observed_at":"2026-05-23T02:42:26.203304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:d64c01d072ff06d044d9e64a55108f0dee7fcd95a54c5c08e44e9146f29b7c96","observation_id":"88fb637f-2325-443c-82ff-053f31c17ad3","resolution":{"observed_at":"2026-05-17T02:40:06.501096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:e861431e6d6dd7f24498c8c4edc14732c3103ada6b915af92d23c40cfa4acd49","observation_id":"b801f8f0-ec35-4899-9195-21f9995690c3","resolution":{"observed_at":"2026-05-19T06:59:03.321024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:4c17bcdaf57ac20fa85cc406255481f3f59f093327fdcfd115f5b0a7e37eefb0","observation_id":"05d07834-058b-47ae-8bb5-ea8b5f0a98fa","resolution":{"observed_at":"2026-05-13T09:36:04.788911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-10T19:38:46.551479Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:121527dc6cef57b2a8571de15371a8ba27408e8ca29c6c762e9c1d165c44fb63","observation_id":"9cc0c66f-1531-4f89-8ac8-883264aa5fc7","resolution":{"observed_at":"2026-05-16T10:31:04.843987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T18:46:11.571831Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.13818"},"observation_digest":"sha256:a6dc18d54775bc3ba93599fae22b24b0273019d6e413bd12a06e978ef533e1c5","observation_id":"9a6a2c45-d65a-4049-aece-f5cc7120eacd","resolution":{"observed_at":"2026-05-22T18:46:56.858678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T00:26:48.291431Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.13958"},"observation_digest":"sha256:d28ccc5d4c9080f3671c01a36e30a6a5894245578de985d81e62a0fdc3280893","observation_id":"43a80739-3434-4af7-8f5c-87ab5e5b45ba","resolution":{"observed_at":"2026-05-14T00:26:48.564435Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:307daf2c6bfce2a15055e619f89446826ce2be050da2d366015105ee2c7e9cfb","observation_id":"ce80f86d-eeb6-4241-9a09-21e0f4e91a77","resolution":{"observed_at":"2026-05-15T19:51:04.906397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:0d3a0b3c70e6093a99e2bc1eabf04e95a98331b21f5d9f4177ca49f5f73cab46","observation_id":"26fc22d3-9293-4848-b07a-8d6b20e8bb00","resolution":{"observed_at":"2026-05-11T05:26:05.824151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:5a4b90c92da4d8e7d101362aff73081da1666c5f9a9b2b0b2c816e73b76baf9d","observation_id":"c7cb80a5-9253-417f-a78f-1b3c45744716","resolution":{"observed_at":"2026-05-22T15:51:45.685027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T09:15:08.193357Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.10978"},"observation_digest":"sha256:a765a400c2140ed7ffde30aadad8af15cf3c8b4fbfc7008ceb922b2a5e152f5e","observation_id":"c9ae3b39-ce40-4366-bf22-bba134d03aec","resolution":{"observed_at":"2026-05-11T09:15:08.421797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:44:35.961914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-09T18:13:25.628969Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.961914Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:5754e22a32fc1c20ce0f1a1a43868adc235355a17f47ef07364726b6f9203e53","observation_id":"b778e018-1636-4f23-891f-dbaaaa36b509","resolution":{"observed_at":"2026-08-07T15:44:35.961914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:34:06.180306Z","title":"DAPO: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-08T07:13:10.579807Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:06.180306Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14652"},"observation_digest":"sha256:aca29f535c35a7ceecb56df055a0bafec25357c632aee992619dce922d736f7f","observation_id":"fa17cf45-45ea-48df-8151-bfd00c7d1077","resolution":{"observed_at":"2026-08-07T15:34:06.180306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:34:53.259571Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.259571Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:df61fc7a09d1efe6f1c509331c1ecee15550810799c2813b9fab636cf862b37c","observation_id":"a6fdcaf4-4f08-469b-9515-792345129f24","resolution":{"observed_at":"2026-08-07T15:34:53.259571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:33:11.407955Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.407955Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5ddf949ff677c56f7db883d8f133b056885bea2384583ace50c85323b4a16398","observation_id":"a25740f0-4537-4d6f-8f54-d60862085901","resolution":{"observed_at":"2026-08-07T15:33:11.407955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:26:54.687871Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-09T16:48:40.808805Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.687871Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:fee9f52a7ede0c1cf50e56b9dd1f8875636b7d9f7a44c311a9efc6ddc52d37d4","observation_id":"33aab401-0b34-4dc2-9521-4f7dd023735e","resolution":{"observed_at":"2026-08-07T15:26:54.687871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:27:02.445271Z","title":"arXiv preprint arXiv:2503.14476 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-10T08:39:37.621137Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:02.445271Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.15146"},"observation_digest":"sha256:a00e33ad0647adc36be6e9209b471b93361351d32b75bdc4b715375de8db8e0c","observation_id":"d17c69fb-0447-4821-94ee-8b7e972aff5c","resolution":{"observed_at":"2026-08-07T15:27:02.445271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:18:02.954245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15612","last_updated":"2025-05-21T15:03:26Z","snapshot_observed_at":"2026-08-08T10:38:46.099993Z","submitted_at":"2025-05-21T15:03:26Z","title":"Learn to Reason Efficiently with Adaptive Length-based Reward Shaping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:18:02.954245Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.15612"},"observation_digest":"sha256:bd6b6721e2be9a0280ba19273a3caef05a7d8b8aa7c82929bc6adadf6f1dd3f5","observation_id":"41384598-14da-41dc-ae07-b941ab3cd98d","resolution":{"observed_at":"2026-08-07T15:18:02.954245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:11:38.902088Z","title":"CoRR, abs/2503.14476","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16022","last_updated":"2025-09-02T20:28:53Z","snapshot_observed_at":"2026-08-07T15:06:08.884956Z","submitted_at":"2025-05-21T21:12:35Z","title":"NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:38.902088Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16022"},"observation_digest":"sha256:d919381b5a846589c41c3b07bd00daffc2fa60be47c601de32f12e5f104e77d6","observation_id":"474c2c7b-1cc0-44be-99c4-f81dfbc43091","resolution":{"observed_at":"2026-08-07T15:11:38.902088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:07:10.758735Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.758735Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:617f9a74ee44a57b638f476b007b5f5844075f48afe2025e39e1eb9f4f481af2","observation_id":"f9423a99-3bc6-4f52-a8cb-ee85a07db547","resolution":{"observed_at":"2026-08-07T15:07:10.758735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:06:35.487503Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-09T23:26:41.871607Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.487503Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:42aab4b6578f6ffb8a3fd94aced2fb1641639677ccd3008290f891abab13a497","observation_id":"510d0643-00d6-4fef-aef8-1ab9ad7221ec","resolution":{"observed_at":"2026-08-07T15:06:35.487503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:06:08.462641Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.462641Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8458d421478b91ae1cad47608bedd815521977dd4f737367fa42d9dcbf519aae","observation_id":"4ee74034-adfa-4c42-8c6b-7a8371bd8dbd","resolution":{"observed_at":"2026-08-07T15:06:08.462641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:01:52.623494Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16582","last_updated":"2025-05-26T10:07:05Z","snapshot_observed_at":"2026-08-08T23:24:39.055718Z","submitted_at":"2025-05-22T12:17:13Z","title":"O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:52.623494Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16582"},"observation_digest":"sha256:de41086a39f9349423b48e2d5f8a931beff394ee03eafa316d85bfb99efe6366","observation_id":"6d5116c2-3996-4605-802c-33106f2444d1","resolution":{"observed_at":"2026-08-07T15:01:52.623494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:01:38.625405Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:38.625405Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:97df167b0a6533c45e55f5debf90443164e88c074460acfdf415e7d95456ebf1","observation_id":"f137afa9-0a97-4d25-9cc9-51b11a59b0c6","resolution":{"observed_at":"2026-08-07T15:01:38.625405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:58:20.133374Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16810","last_updated":"2025-05-26T08:51:17Z","snapshot_observed_at":"2026-08-07T20:42:39.359884Z","submitted_at":"2025-05-22T15:49:38Z","title":"DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:20.133374Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16810"},"observation_digest":"sha256:051438e7431500a702f77ca9126bd676f3b78ab84591efc44de43ee23a56861f","observation_id":"10cbe391-988a-4570-9c01-550f63ae962e","resolution":{"observed_at":"2026-08-07T14:58:20.133374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:55:17.321595Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17005","last_updated":"2025-05-22T17:58:26Z","snapshot_observed_at":"2026-08-09T19:43:56.609455Z","submitted_at":"2025-05-22T17:58:26Z","title":"R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:17.321595Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17005"},"observation_digest":"sha256:c1b58af0967d3077e7ef179abaecfe0c00c01a73403b3cf0bbe866cd60edd2ec","observation_id":"e629553a-ec71-4f4c-aeb8-be8a9c61d419","resolution":{"observed_at":"2026-08-07T14:55:17.321595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:55:56.192183Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.192183Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7299c01bea2de4c18149ad1c2d2caadeaa73b54645015f422cad70faa81f55f6","observation_id":"249c4d65-1e62-49b1-8920-e501a572bab4","resolution":{"observed_at":"2026-08-07T14:55:56.192183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:46:34.445900Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17659","last_updated":"2026-06-02T02:54:45Z","snapshot_observed_at":"2026-08-07T14:40:41.464905Z","submitted_at":"2025-05-23T09:22:19Z","title":"Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:34.445900Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17659"},"observation_digest":"sha256:7b9077520b28ae80e16cd9ce60133389fd36592554bb70247420112e5cb27d7f","observation_id":"62fb29e7-735c-4b34-9cc0-4231cb58ef34","resolution":{"observed_at":"2026-08-07T14:46:34.445900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:47:59.379000Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-09T18:30:22.847305Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.379000Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:a0794b3cf4c40f2d412a9ede232c0e55d6405c4830f576b4bd37a2e8f0727afd","observation_id":"fd620298-cab5-4451-a2aa-84df904a8cb4","resolution":{"observed_at":"2026-08-07T14:47:59.379000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:41:42.685105Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17988","last_updated":"2025-08-05T11:46:13Z","snapshot_observed_at":"2026-08-09T20:50:22.177201Z","submitted_at":"2025-05-23T14:55:22Z","title":"Towards Revealing the Effectiveness of Small-Scale Fine-tuning in R1-style Reinforcement Learning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:41:42.685105Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17988"},"observation_digest":"sha256:3f10f3c256c1efd44922659232a2741355150f511abe302a5ae322369d70ba19","observation_id":"63cbc4b7-953c-499d-986d-d3fc73d92757","resolution":{"observed_at":"2026-08-07T14:41:42.685105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:39:54.965005Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18071","last_updated":"2025-07-07T17:38:20Z","snapshot_observed_at":"2026-08-10T16:53:44.413048Z","submitted_at":"2025-05-23T16:16:46Z","title":"Extended Inductive Reasoning for Personalized Preference Inference from Behavioral Signals","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:54.965005Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18071"},"observation_digest":"sha256:a666232ef05ff17eb5f4bd1b9f8c5bf143e50d944bf69b41cac4acdebbee6f30","observation_id":"4b71ca5b-2ab2-46d5-8779-29b6180e8744","resolution":{"observed_at":"2026-08-07T14:39:54.965005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:34:10.188950Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18492","last_updated":"2026-06-30T15:33:33Z","snapshot_observed_at":"2026-08-10T00:16:39.106806Z","submitted_at":"2025-05-24T03:52:25Z","title":"Formally Solving Answer-Construction Problems in Lean","version":6},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:10.188950Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18492"},"observation_digest":"sha256:bf04184c99ac7194445019d40354316b1da1e7ee6383aade4ffb9305f37b8ee9","observation_id":"a19cde46-1023-442b-802e-b09dc1152cda","resolution":{"observed_at":"2026-08-07T14:34:10.188950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:31:12.705003Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:12.705003Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:66cfa705923466dc8f276161bab51f7c611e184abeb9c195feacb5e3d2c236f0","observation_id":"d9a22cf9-07fd-4372-a117-a775ac9d9bc1","resolution":{"observed_at":"2026-08-07T14:31:12.705003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:c0f6c474e013a18c4f1bbe70a67a42bd5e190326056a6af27f33866536eefd0c","observation_id":"ad890374-dd81-4fc5-9731-dd33c7d49399","resolution":{"observed_at":"2026-05-16T12:55:40.372850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:29:33.323315Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.323315Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:cd3455371a0142945b0019bcc3ea2adc7c5c564aeebdeebfcbeefb5720561fac","observation_id":"1e7a4dd1-a25f-4783-b71d-bac8905ba860","resolution":{"observed_at":"2026-08-07T14:29:33.323315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.19075","last_updated":"2026-05-20T08:13:51Z","snapshot_observed_at":"2026-07-30T16:12:36.732031Z","submitted_at":"2025-05-25T10:19:10Z","title":"Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T01:16:51.288077Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19075"},"observation_digest":"sha256:8ec573d87605a9ea11c20e9ac3e87b01d04efcdf831c26b008ac14b5062ec2c2","observation_id":"69316f9c-050b-4ccf-8937-93ae51d826a2","resolution":{"observed_at":"2026-05-22T01:20:52.124513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:21:21.123794Z","title":"DAPO: an open-source LLM reinforcement learning system at scale.CoRR, abs/2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19300","last_updated":"2025-05-25T20:20:04Z","snapshot_observed_at":"2026-08-11T03:01:07.158699Z","submitted_at":"2025-05-25T20:20:04Z","title":"SituatedThinker: Grounding LLM Reasoning with Real-World through Situated Thinking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:21.123794Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19300"},"observation_digest":"sha256:4948970880cff656c4b7344d547249627dfd7303272aa3d110b8351abe777ada","observation_id":"50d49ff3-dcaf-46aa-922e-d6ae27d2001d","resolution":{"observed_at":"2026-08-07T14:21:21.123794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:16:36.086883Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-11T00:30:55.892570Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.086883Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:4ab891ef721c8ad59253a61ccde0b6433b45ef5e5d6a697153e69de985d8c9f6","observation_id":"a53ce49d-145b-4e6a-ac43-cc76e727053d","resolution":{"observed_at":"2026-08-07T14:16:36.086883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:14:33.391350Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19641","last_updated":"2025-06-04T05:08:08Z","snapshot_observed_at":"2026-08-07T14:07:26.838295Z","submitted_at":"2025-05-26T07:59:36Z","title":"SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:33.391350Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19641"},"observation_digest":"sha256:0a6153796cf03b522f4655439367e263af45edf150fbb034fb7414d02dacb59d","observation_id":"df8213ea-708b-44fc-8778-90e3ff9b27be","resolution":{"observed_at":"2026-08-07T14:14:33.391350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:13:12.741388Z","title":"DAPO: an open-source LLM reinforcement learning system at scale.CoRR, abs/2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:12.741388Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ebf6309e060fef32ca810365765ba429e23965e7a8198cf5af114411776cfa00","observation_id":"2ac65f12-04af-4f88-9429-c02619ba8415","resolution":{"observed_at":"2026-08-07T14:13:12.741388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:11:08.074540Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-08-07T16:09:17.796555Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.074540Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.19914"},"observation_digest":"sha256:b56d0ede7d02462fbb23ea7519a79c862fcf27c13caac5fcb6fc00feece92ce2","observation_id":"798cd88d-0aea-4720-b162-2f587ba6f6d6","resolution":{"observed_at":"2026-08-07T14:11:08.074540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:00:09.367525Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:09.367525Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:29d4c4e30f73d1c817d744fd72bb199165913e576f3d2a5a1f1247c0f0f61edc","observation_id":"b333d74e-723b-4e2f-9f79-a3f8e37df4f0","resolution":{"observed_at":"2026-08-07T14:00:09.367525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:59:16.157460Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20285","last_updated":"2025-05-27T06:46:24Z","snapshot_observed_at":"2026-08-09T00:25:41.948655Z","submitted_at":"2025-05-26T17:58:50Z","title":"MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:16.157460Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20285"},"observation_digest":"sha256:9bf6290e7e38bc3c240e86d8e996a7cda6b7fdfb3e79c19d136102de04f0ba1b","observation_id":"d5e259d3-2194-40a6-bdbb-67cc08680aa4","resolution":{"observed_at":"2026-08-07T13:59:16.157460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:38:09.183758Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-08T05:03:17.473169Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:09.183758Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:5933e6c41a6b5eae26f22e9063055a61c4042cd95890f5ff67dad487fc403ce5","observation_id":"1e79e282-ae10-462a-b77d-59ed721a99a5","resolution":{"observed_at":"2026-08-07T14:38:09.183758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:46:40.382950Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-07T16:09:26.563632Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.382950Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:c97c43dab9e2dc7b875abc6473460b581cfb9975c46eab52f4a9d164e75a8d6b","observation_id":"b5f5ff59-2f3b-4638-b652-9df06b60a614","resolution":{"observed_at":"2026-08-07T13:46:40.382950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:35:54.837737Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.837737Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e3cc61de2d98c0f49a7a47e45a6fcea0029f1cdd98260851790fcb772ab8967c","observation_id":"dfbbdad7-3e5b-4f76-a2f8-96a7f26b2e10","resolution":{"observed_at":"2026-08-07T13:35:54.837737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:28:16.275086Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21807","last_updated":"2025-06-30T02:01:55Z","snapshot_observed_at":"2026-08-08T01:30:47.387547Z","submitted_at":"2025-05-27T22:23:11Z","title":"TabReason: A Reinforcement Learning-Enhanced Reasoning LLM for Explainable Tabular Data Prediction","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:28:16.275086Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21807"},"observation_digest":"sha256:296d8e3d9c5b07f5788f39b85eb7269827e537786d1eedad537f18f5acd88613","observation_id":"89a3db25-1141-493b-a92f-89c2556b3b23","resolution":{"observed_at":"2026-08-07T13:28:16.275086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:16:54.947416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22257","last_updated":"2025-05-30T03:55:41Z","snapshot_observed_at":"2026-08-07T13:09:20.609571Z","submitted_at":"2025-05-28T11:42:33Z","title":"Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:54.947416Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22257"},"observation_digest":"sha256:7cae56e76767fe147ab7f76f0dd2b91bc85848dcb7ccddfe7a248aba1e8677e1","observation_id":"3ed4233d-21bb-4557-800f-f04794c7317e","resolution":{"observed_at":"2026-08-07T13:16:54.947416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T04:26:47.283983Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22312"},"observation_digest":"sha256:1f7c8c631b2bd9c0edf9dfdabeb53bd3d707c1aa4d67156e5607de859d37d121","observation_id":"9dd26810-09e8-4b80-a6fc-02256ad6fec6","resolution":{"observed_at":"2026-05-17T04:26:47.368219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:16:18.016091Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22375","last_updated":"2025-05-29T01:59:00Z","snapshot_observed_at":"2026-08-07T13:06:05.806802Z","submitted_at":"2025-05-28T14:03:02Z","title":"Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.016091Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22375"},"observation_digest":"sha256:acdd65886aa4dd8898493bf61fb94c9ac39a1d0ca827581348aa689cdd699b56","observation_id":"f8a98493-4dc1-47da-a516-9671f54832fd","resolution":{"observed_at":"2026-08-07T13:16:18.016091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:14:33.280845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22430","last_updated":"2025-05-28T14:55:33Z","snapshot_observed_at":"2026-08-07T13:05:09.521160Z","submitted_at":"2025-05-28T14:55:33Z","title":"RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:14:33.280845Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22430"},"observation_digest":"sha256:d6ba496d562e3a0421344e4ae2fa7dae471434f54ef7fc72c31df6a0c55be2c5","observation_id":"d53205b8-a3e2-48cf-ad19-68ecbb65810e","resolution":{"observed_at":"2026-08-07T13:14:33.280845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:12:59.475979Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22501","last_updated":"2025-05-28T15:50:48Z","snapshot_observed_at":"2026-08-10T17:54:16.376507Z","submitted_at":"2025-05-28T15:50:48Z","title":"EvolveSearch: An Iterative Self-Evolving Search Agent","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.475979Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22501"},"observation_digest":"sha256:89262aff4ea6e783bad6056b4e93f3c52863f33383a949c87b791a13f000bbcc","observation_id":"6460a496-1546-47db-89c7-7bfca8d0211a","resolution":{"observed_at":"2026-08-07T13:12:59.475979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:08:58.025183Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:58.025183Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.22648"},"observation_digest":"sha256:f29fbbd74f7e2358b8b8cd38edaf17a82579da39d5026f0bc814b31ef96979aa","observation_id":"820e3921-aa3e-4902-b365-a3e0e076264f","resolution":{"observed_at":"2026-08-07T13:08:58.025183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:59:48.554997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.554997Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:5e58456551607ba506193882cffe730766816710021e6593465b048b5d0364ef","observation_id":"aa45b29e-9039-478e-b74b-7f210b2826c2","resolution":{"observed_at":"2026-08-07T12:59:48.554997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:45:32.967235Z","title":"DAPO:an open-source llm reinforcement learning system at scale.arXiv preprint CoRR, abs/2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-09T17:49:59.281910Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:32.967235Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.23646"},"observation_digest":"sha256:008c30720e6648b1300abe2d7a7db4964bcfc3df45f73d6c714cb0ec2a2a48b7","observation_id":"d43a438e-6464-4aa2-9aca-a28846594327","resolution":{"observed_at":"2026-08-07T12:45:32.967235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:6e84927a43898f772fd0fc6dbb587aacd79f689a499058d158af5c5a0edd03cd","observation_id":"681ebc7e-91ea-4c3c-b865-518350f00f3b","resolution":{"observed_at":"2026-05-22T01:05:52.198652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:41:26.439832Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23762","last_updated":"2025-05-29T17:59:51Z","snapshot_observed_at":"2026-08-10T17:18:04.954453Z","submitted_at":"2025-05-29T17:59:51Z","title":"ZeroGUI: Automating Online GUI Learning at Zero Human Cost","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:26.439832Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.23762"},"observation_digest":"sha256:28ca5ec2143d8b68105ff9deb06bff618f5119109af7ad52d545f5f92dc0da8d","observation_id":"2fa84e31-7281-42fd-bf91-ebeed07c9b66","resolution":{"observed_at":"2026-08-07T12:41:26.439832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:40:13.610491Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24105","last_updated":"2025-05-30T01:13:22Z","snapshot_observed_at":"2026-08-09T13:46:57.143129Z","submitted_at":"2025-05-30T01:13:22Z","title":"Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:13.610491Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24105"},"observation_digest":"sha256:62dc758f8581f97a7051b17c77c68004cd225e646943200b21ca08b11525778b","observation_id":"9c2a96cf-38b2-41b9-9ea6-59fc39a26ca3","resolution":{"observed_at":"2026-08-07T12:40:13.610491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:33:12.653152Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24238","last_updated":"2025-06-02T04:16:04Z","snapshot_observed_at":"2026-08-10T15:39:33.509863Z","submitted_at":"2025-05-30T05:54:36Z","title":"MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:12.653152Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24238"},"observation_digest":"sha256:d989f0660e9ee2f4f5e52fc9494a97730059cfb15e66af6be6b36825c5dc1e66","observation_id":"9d8616b4-cc9f-478c-83fe-fa1433f61ea9","resolution":{"observed_at":"2026-08-07T12:33:12.653152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:82b838f72e7c97b6a59da166ab063d7546fcab5046deb053228041acf0165b6f","observation_id":"79e61d0b-a2c8-4729-9c60-20162a21aa35","resolution":{"observed_at":"2026-05-15T14:24:21.986322Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:25:27.818086Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-09T17:09:03.936400Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:27.818086Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24480"},"observation_digest":"sha256:a9f02e6300fbdfe5a3716e5eceb1e0d7299e10b18ce1c88b4fa8ab60ad3a98bb","observation_id":"97176b73-2444-4d0e-8d7e-1cff15f52cb7","resolution":{"observed_at":"2026-08-07T12:25:27.818086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:22:12.867048Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-11T01:02:46.296265Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:12.867048Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:b9c99fa02b45340f138556f2dcf81d504c6f60feae6b87dd659a040c960afbc1","observation_id":"605d6a0f-b46e-45a6-b1fd-25588ab8c0ca","resolution":{"observed_at":"2026-08-07T12:22:12.867048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:19:25.125571Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24875","last_updated":"2025-06-05T17:51:58Z","snapshot_observed_at":"2026-08-08T15:12:18.884282Z","submitted_at":"2025-05-30T17:59:48Z","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:25.125571Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24875"},"observation_digest":"sha256:8298fc9171591c8ea0714dc6d0d34a1d98fc7df6142e5e645bf861adf6e0be87","observation_id":"b9d0d6fc-7e1c-441a-8cf2-ed4ba973b7c1","resolution":{"observed_at":"2026-08-07T12:19:25.125571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:08:19.084919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00439","last_updated":"2025-05-31T07:38:41Z","snapshot_observed_at":"2026-08-10T05:45:33.356379Z","submitted_at":"2025-05-31T07:38:41Z","title":"RLAE: Reinforcement Learning-Assisted Ensemble for LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:19.084919Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.00439"},"observation_digest":"sha256:7962db629eeddb9053e91b27709adcef357290e7831b9895419eeb8161e6f085","observation_id":"a3538b41-65a8-40cd-9408-f3867b7e9582","resolution":{"observed_at":"2026-08-07T12:08:19.084919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:02:47.598747Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:47.598747Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:206a47d19218c02478e62db6556d636ae99b7fa75b57bde7d946321bddb801cd","observation_id":"9af23f9f-4d9b-47fb-8a1b-8f4bbf3eea20","resolution":{"observed_at":"2026-08-07T12:02:47.598747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:55:14.363044Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.363044Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:191e66a1a3316b21df3afe2def0b1c480d53ec5329bfec1022085eafa583210d","observation_id":"f2a6f081-263a-452c-8fcf-e02f9268efb1","resolution":{"observed_at":"2026-08-07T11:55:14.363044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:51:29.765282Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:29.765282Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:25d13ebc1fdde2f47aeedd04f8dd1070ce61f7987063a02581a7d97d77021533","observation_id":"8ea6bd0d-5eff-42cd-8422-36b9b3d4ecad","resolution":{"observed_at":"2026-08-07T11:51:29.765282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T12:12:08.724844Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.01939"},"observation_digest":"sha256:ce0bb11124a5c3b9664c807d0a1d0f4877f1eedeff62028cb80bb93032b022b4","observation_id":"4ada27f0-ae0a-47d7-ac19-3c065fd19407","resolution":{"observed_at":"2026-05-12T12:12:08.990663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:35:47.704809Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02096","last_updated":"2025-06-02T17:45:16Z","snapshot_observed_at":"2026-08-07T12:51:05.147362Z","submitted_at":"2025-06-02T17:45:16Z","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:35:47.704809Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02096"},"observation_digest":"sha256:88a4adbee2cf46c38e9d69c412f9b66f7f0f2d7aa75b118c46a45cb823a890b6","observation_id":"4d6ed220-c3b6-406f-a283-3abb183608da","resolution":{"observed_at":"2026-08-07T11:35:47.704809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:33:56.907899Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.907899Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:f089f0b2abb397ade50593432d7072007598522138307ad976ec0d3c547f1f7e","observation_id":"209e468b-62bb-4f5a-b75b-ea1eb0702bd0","resolution":{"observed_at":"2026-08-07T11:33:56.907899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:36:08.474963Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.474963Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:f26a1ab32da27952d2616c8b6b1e70883214d4e009ab98f369cbc2c7832c9df3","observation_id":"24986511-57a8-42cf-965a-fad7904e2c78","resolution":{"observed_at":"2026-08-07T11:36:08.474963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:31:54.358241Z","title":"operation_audit.log","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-10T14:39:11.382146Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.358241Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:3e1a97e6e0f7094baf4fe907634cac5ce53a0cb36f63e1b7fcedfd9c30f9c14a","observation_id":"378849d3-2eeb-4410-9d09-7f42e5337343","resolution":{"observed_at":"2026-08-07T11:31:54.358241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:31:02.597250Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-08T15:13:20.527982Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:31:02.597250Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02355"},"observation_digest":"sha256:cd19f86f76b96c933b17962d484f972a0fd2cc7575d84362275dc219405e0b0d","observation_id":"d2ab2182-d128-4808-a244-e300fc9dbb07","resolution":{"observed_at":"2026-08-07T11:31:02.597250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:17:37.613949Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-10T16:30:05.424281Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:37.613949Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:696dc34ba5a76121741d030e5a4de9c61ce79b576d9fea4cc9a64411d0c34502","observation_id":"1d3da582-05a5-4454-8db3-fe030f03c885","resolution":{"observed_at":"2026-08-07T11:17:37.613949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:04:56.907014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03524","last_updated":"2025-06-05T03:26:05Z","snapshot_observed_at":"2026-08-09T04:58:38.414289Z","submitted_at":"2025-06-04T03:17:19Z","title":"Seed-Coder: Let the Code Model Curate Data for Itself","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:56.907014Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.03524"},"observation_digest":"sha256:be405efa6095261b8899266e86d5f77aa40b4024f44b091fa1d75c2af90387e6","observation_id":"cdf9bd70-ff73-41df-b817-ebc7834f7af2","resolution":{"observed_at":"2026-08-07T11:04:56.907014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T10:54:07.870856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04065","last_updated":"2025-06-04T15:31:46Z","snapshot_observed_at":"2026-08-10T17:03:49.937634Z","submitted_at":"2025-06-04T15:31:46Z","title":"Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:07.870856Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.04065"},"observation_digest":"sha256:64b1cf01b1b519871a2dd04ea3892357586ca8a0a5dc73779c1c721f25104e42","observation_id":"ae02c8c2-824d-4188-926e-b4aa1678da7f","resolution":{"observed_at":"2026-08-07T10:54:07.870856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T10:40:07.799079Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04746","last_updated":"2025-06-05T08:27:34Z","snapshot_observed_at":"2026-08-10T22:24:25.860603Z","submitted_at":"2025-06-05T08:27:34Z","title":"Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:40:07.799079Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.04746"},"observation_digest":"sha256:2a4a375e3eafc0dfc37f74c666b1dd45f04406d8518868d0d09ec9b7ecef4a0a","observation_id":"98430df0-679c-475b-be78-8a36753bf931","resolution":{"observed_at":"2026-08-07T10:40:07.799079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T10:34:04.451704Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05007","last_updated":"2025-06-05T13:17:50Z","snapshot_observed_at":"2026-08-09T15:56:10.226289Z","submitted_at":"2025-06-05T13:17:50Z","title":"QiMeng: Fully Automated Hardware and Software Design for Processor Chip","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:34:04.451704Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.05007"},"observation_digest":"sha256:cb3448be7a3904d95da4146aa0cef6751a2a3650f226a8b7b62f58332e2c6358","observation_id":"71e6ada2-e435-4c2c-ac6f-b27145cbf544","resolution":{"observed_at":"2026-08-07T10:34:04.451704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2506.05760","last_updated":"2026-04-19T08:41:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-06T05:40:39Z","title":"Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T10:52:32.933138Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.05760"},"observation_digest":"sha256:d566231dcf55ed9f23a5067771f9087992ef089e35974ab1e9cbfac9f32be96c","observation_id":"5038f393-df94-4407-8ad9-d8331a54f79a","resolution":{"observed_at":"2026-05-19T10:53:02.882074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T10:16:53.969387Z","title":"If multiple feasible solutions exist, output any one of them","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05817","last_updated":"2025-06-06T07:29:01Z","snapshot_observed_at":"2026-08-09T19:50:40.350535Z","submitted_at":"2025-06-06T07:29:01Z","title":"CodeContests+: High-Quality Test Case Generation for Competitive Programming","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:53.969387Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.05817"},"observation_digest":"sha256:19af3ce7b79cd2dd4fb076d9e9b5f50c3198fd8e4eeeaf261780b7268079f275","observation_id":"381b6018-32b7-4864-a7f0-3657153c080d","resolution":{"observed_at":"2026-08-07T10:16:53.969387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T06:02:33.052451Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T21:55:43.371585Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.052451Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:a6764c81a5098c3960498426c6c2a85a4abd56da21c139df4fb6220fd06baeda","observation_id":"2aa1046d-820a-47b7-93e7-aa2b8b71956e","resolution":{"observed_at":"2026-08-07T06:02:33.052451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:49:40.129855Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.129855Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:37a27b200979753f91d94bc5450d6b3577af592aa30434503a670ffd7bbf6d5c","observation_id":"6322f138-1f81-47ad-8802-2bdb1a21490b","resolution":{"observed_at":"2026-08-07T05:49:40.129855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:41:58.224328Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-08-07T05:30:38.669027Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:58.224328Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07468"},"observation_digest":"sha256:283497a70eb9ec6ecb9955b903aa8ee95cdece74fbd968f9439717849984fb7c","observation_id":"32bd10b1-7c45-47e1-9654-29027edc5667","resolution":{"observed_at":"2026-08-07T05:41:58.224328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:31:22.420798Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-08-09T02:25:55.181285Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:22.420798Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07900"},"observation_digest":"sha256:2846056331318cc46acb750651ffe441bf1284fe537a2f26617732499073c1db","observation_id":"0505c5db-18fa-4fd8-bd05-48cf231bc2a9","resolution":{"observed_at":"2026-08-07T05:31:22.420798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:30:27.211480Z","title":"arXiv:2503.14476 [cs.LG] https://arxiv.org/abs/2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07963","last_updated":"2025-09-08T14:31:08Z","snapshot_observed_at":"2026-08-07T20:38:55.415021Z","submitted_at":"2025-06-09T17:38:45Z","title":"SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:27.211480Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07963"},"observation_digest":"sha256:9ea46c4ec3ac542710fe646dd0bba389efac37d1d41f94b108c634e6bf7e1a77","observation_id":"1605fb19-019b-4012-bcce-2f1da7f47d0e","resolution":{"observed_at":"2026-08-07T05:30:27.211480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:26:22.142165Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.ArXiv, abs/2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-10T06:19:15.846428Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.142165Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:31cf71e4599c07a3dacb36f5e047660e5810c3a859d65af027ff622b8d654aa1","observation_id":"99f5089e-12c0-4f1e-b071-e2dbd9917abd","resolution":{"observed_at":"2026-08-07T05:26:22.142165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:14:47.543926Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.543926Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:c83498e3d02d996c2003248bfdef922e81dd8cc6dbe5f04700dfeb4f85b06329","observation_id":"d56dc75e-cda6-408c-84b6-5867ff745e4d","resolution":{"observed_at":"2026-08-07T05:14:47.543926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:09:45.745522Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.745522Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:176648dda815d0b95ee811aea549142d7a14057ed85dd219ee9c6185411674a2","observation_id":"56f7a275-2495-411c-a8cd-15faa612de94","resolution":{"observed_at":"2026-08-07T05:09:45.745522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:01:24.263254Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.263254Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:d0acc5cf790c2f936d614f02ebc2ffa3fe0af00f788c92b746d8cfcc72c43100","observation_id":"42b9d5fd-007a-4d0f-8532-9d229f7347a2","resolution":{"observed_at":"2026-08-07T05:01:24.263254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:03:29.861106Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.861106Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4fb057709fcbbdfc96e2c1ac59ff13bd8c3e8b9fc847361f9fee61e25656f636","observation_id":"8b61a26d-890a-4211-83ab-ee5887694417","resolution":{"observed_at":"2026-08-07T05:03:29.861106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:53:58.288675Z","title":"Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Shiji Song, and Gao Huang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-08T13:48:32.149553Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:58.288675Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.09340"},"observation_digest":"sha256:a513627cf3a9e6f31c33cf04c8022e1d651a47a59aa9abad3fb674bcebdb1f77","observation_id":"cfc66114-dd6a-40db-8a4e-b2fb90b34213","resolution":{"observed_at":"2026-08-07T04:53:58.288675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:46:22.944112Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09820","last_updated":"2025-06-12T12:50:37Z","snapshot_observed_at":"2026-08-10T03:18:33.651754Z","submitted_at":"2025-06-11T14:59:02Z","title":"CoRT: Code-integrated Reasoning within Thinking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:22.944112Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.09820"},"observation_digest":"sha256:31711ed5665e86e3ba2c029eee06f599c4a379caddc21a69bbf064c0adceed28","observation_id":"2908b548-4c0e-41ef-a3f6-4d729ffb6861","resolution":{"observed_at":"2026-08-07T04:46:22.944112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:39:38.188492Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-08T09:07:12.052492Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:38.188492Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.10406"},"observation_digest":"sha256:38729e6f60801174e0765035089074c3c4cda7f2e670aba443795c90525fcfd8","observation_id":"02b7edf3-4df0-4b51-9275-cd2534582e1c","resolution":{"observed_at":"2026-08-07T04:39:38.188492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:19:26.415218Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.415218Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:88e5560a077c725233c2c231430c9e3dc4ab705e91bbcbd3df3929db8ff778f7","observation_id":"df998082-8d39-4586-bd26-e31f6501b6fd","resolution":{"observed_at":"2026-08-07T04:19:26.415218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:07:34.797292Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.797292Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:0e42419f2c6c2b159c62f4a21192646f301b641442833b2c78b558a1caa85d9f","observation_id":"907799d7-17df-4531-9005-ab4ee4715382","resolution":{"observed_at":"2026-08-07T04:07:34.797292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T01:05:26.776323Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11986","last_updated":"2025-06-13T17:46:02Z","snapshot_observed_at":"2026-08-10T10:04:27.415262Z","submitted_at":"2025-06-13T17:46:02Z","title":"Schema-R1: A reasoning training approach for schema linking in Text-to-SQL Task","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T01:05:26.776323Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.11986"},"observation_digest":"sha256:43c567c0fa1c4dc1c840ee1aff9b00e79245045efbfa4fba3aa2cff1bf089c41","observation_id":"30ab0835-abef-46be-821d-04b704d77905","resolution":{"observed_at":"2026-08-07T01:05:26.776323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T00:40:35.824398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:35.824398Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:85350594da835d23b9192161dd343f6a9fb025323333fa6dd5d654fb08bec316","observation_id":"4fe48f52-8d98-45e2-ae22-e99dab76d1b2","resolution":{"observed_at":"2026-08-07T00:40:35.824398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T00:41:36.411140Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-09T20:09:37.590476Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:36.411140Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:48a0ae0468d9a2ef10d95d6e829418ffbd8f4b4fea44c53ffb488f4cb4971540","observation_id":"b93c90ad-17e2-412f-aad4-b3c5f5b4155f","resolution":{"observed_at":"2026-08-07T00:41:36.411140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:87ebfb07f8ecc3605b1bf92881ff5a8a1a701a9dcd1c15a2c717c097bb8e6a00","observation_id":"c92f8f91-3a7a-4a5d-94f8-4032ea539520","resolution":{"observed_at":"2026-05-19T09:52:14.083201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.14476/citation-record","integrity":"/paper/2503.14476/integrity","json":"/paper/2503.14476/citation-record.json","paper":"/paper/2503.14476"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms","venue":null,"work_id":"16f7723e-0b48-4125-885f-310de5bf2c28","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:e80d3aa545ff7e5a1f71ae853ba1474b693beac5bfb458943067292a68fe5a0f","observation_id":"bf69f2fb-4194-4775-b396-3b04c8c958fa","resolution":{"observed_at":"2026-05-22T23:37:16.447246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:fa268ee295a7c74c570d424550c8b3d332f16124e3fc1d3adc09a261faf89e1c","observation_id":"82c25e79-80e3-4b0f-b478-56ec6b11807a","resolution":{"observed_at":"2026-05-22T23:35:13.475103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:4324b791988c920574ed7d5c2084c5cec893e8f211f63efd7105b73a40a2fbf4","observation_id":"a62947e7-0eac-41a5-8f6b-cdaa2a572af1","resolution":{"observed_at":"2026-05-22T23:35:13.466182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"94e4f554-6753-4090-a205-31f3ac515118","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:9fac7db11eada33af0b23106e884d820ea88f5d477ddced167ccbd7c56645c2f","observation_id":"7e2e3413-76a2-4acc-b0fe-7b40996b56d7","resolution":{"observed_at":"2026-05-22T23:37:16.443465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"1109e15b-0e77-4d1f-9248-ed7317a8400c","year":1901},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:4d27946a142c7087438b1b062d9b907f58822accb156c513e7f880b5b038aea4","observation_id":"d2d6d9f1-71d9-4df4-aeee-716c0f95e2b2","resolution":{"observed_at":"2026-05-22T23:37:16.426165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"815cff7d-cce6-4360-ba9e-2c1f9f716e29","year":2023},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:05af1e406c05a2a3256f00ec39480a2a903594270b57c2bfddd4257fd394c146","observation_id":"781fd30a-94ab-44fe-8414-b59507835446","resolution":{"observed_at":"2026-05-22T23:37:16.430899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:58cef0ba207cf4b0fbdf2d0ffaaba26b9b1346f4dda9ab3f638c98dd94df9ca8","observation_id":"f2ddb11d-d609-41ff-9aab-a80de5b2b064","resolution":{"observed_at":"2026-05-22T23:35:13.482523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"21963273-aa23-44a9-be08-9bd3fd2bc191","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:1f966385d08af761bf5bcdbd683076e131e1b6d8192dd4437bb870ed9d79df84","observation_id":"45bee8c6-9b58-4c89-ba51-2e1c93245934","resolution":{"observed_at":"2026-05-22T23:37:16.435347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 flash thinking","venue":null,"work_id":"ae6b4683-11f7-4205-91f3-a116f2c49f43","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:0a6351970cfeb6a84276dc7234d799c5b3bf96813e472bb9420e4e2a326ad766","observation_id":"73206345-4efe-4019-9a7e-a589635c6f66","resolution":{"observed_at":"2026-05-22T23:37:16.439254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwq-32b: Embracing the power of reinforcement learning","venue":null,"work_id":"12e2a39c-a4e7-42ff-9370-7a9e59fe7911","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:50be570c2a566fd3e057e4f01a02e05afa6f4f0b6401463ca26d62e04cb2f420","observation_id":"b8e585ba-663c-4daa-91ff-39515fadc3e4","resolution":{"observed_at":"2026-05-22T23:37:16.421829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:30c13a5fb40c4f06263001357adc1ad13e20758ab45aef8bbe03bfef3a2352cd","observation_id":"ed0712cc-0800-4619-b28c-bdfa039ab602","resolution":{"observed_at":"2026-05-22T23:35:13.448053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:e503eff9246ccc57afdc510792d751e9abe38e775cffb6193984de2ee1786398","observation_id":"325e40a2-7203-4c23-a302-e01e0e0d2c30","resolution":{"observed_at":"2026-05-22T23:35:13.440483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":"2503.04548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-07-03T04:27:36.567324Z","title":"An empirical study on eliciting and improving r1-like reasoning models","venue":null,"work_id":"5d962724-fdfd-471c-b457-0c9fd4d5aa44","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:d9471354804c1a84e964d6a41dd64f236202746e01dfbcc05517742c0f07c881","observation_id":"f33de9cf-eec2-4453-83db-1f09bebf594e","resolution":{"observed_at":"2026-05-22T23:35:13.444477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-reasoner- zero: An open source approach to scaling reinforcement learning on the base model.https://github.com/ Open-Reasoner-Zero/Open-Reasoner-Zero","venue":null,"work_id":"54b7bd84-71c5-407b-a1a1-90e40eca29a4","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:337f8816c367fe929d6bceaab05aab9bf14865e734c049a1b1f2f00662a949f4","observation_id":"ac6bb475-0f2f-4fbb-b2b8-202823f44509","resolution":{"observed_at":"2026-05-22T23:37:16.417671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:3915bac7d202ea93f6a7955f351edf0098d533e65a3010a140bbb93f4e4ef113","observation_id":"2ab05f3a-37d7-484c-9821-675e734778c7","resolution":{"observed_at":"2026-05-22T23:35:13.452225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:b6a0e16188b2ffd7518744a9352a1e4f258e38df3283b8b87716ae0257113148","observation_id":"472c55df-44bb-47d7-bd87-d01c7ce34dbe","resolution":{"observed_at":"2026-05-22T23:35:13.462057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12863","last_updated":"2025-03-10T14:24:29Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-12T13:16:50Z","title":"Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12863","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token-supervised value models for enhancing mathematical reasoning capabilities of large language models","venue":null,"work_id":"cfb35665-7b4f-4d2b-acf5-cf89c85d3f61","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2407.12863","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:e4ee1fb8b0f4da4b21b2dea5a062eeacfb9825d3f4c3ca8e5e7f5c150f1579d2","observation_id":"c4faa081-3ba1-411f-b4ef-6dbde192dc74","resolution":{"observed_at":"2026-05-22T23:35:13.431013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:bdaa7d513630c73181fba59ba23979d6cc52f59cf7b2be4148b43678c9ac2edd","observation_id":"531ef94a-12a6-4835-b0ef-ade283579f4a","resolution":{"observed_at":"2026-05-22T23:35:13.436228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T17:33:49.286933Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:5e2a00b8a3b4211905d2003b80104864a2b1acf7d2e4b33e016de13195af6b80","observation_id":"753f2d48-65e1-43e0-b6fa-b36884c6ae38","resolution":{"observed_at":"2026-05-22T23:35:13.471029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:cf934d3ec73fe7a37ce3cc1f80c2d21be829a608b897ff824a7ef174130da9d8","observation_id":"8bee5c55-19b4-44cf-9ad3-9094548446d2","resolution":{"observed_at":"2026-05-22T23:35:13.427523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:734ad9e9e8a2912316115905be72279ad295d607d3c317e5bc102a098aaa4935","observation_id":"fef29dde-0eac-4c94-8e8d-9833432dab40","resolution":{"observed_at":"2026-05-22T23:35:13.479105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":"bb45499d-7bf7-464a-8e2c-bb5d6fa5bfa6","year":2018},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:85f74dd6bc2c5facc2ac656b583b485682c6870a5161c8ca501c969cfb27897a","observation_id":"f96911f5-35ca-4ec7-8304-23d64f07c98c","resolution":{"observed_at":"2026-05-22T23:37:16.412096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"14145e64-e20e-42cf-989d-5af8910c2a0c","year":2022},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:65620607d553c13a451526acbbd40884ac1f8d962233ceed31199bd39067269f","observation_id":"6304fbeb-1beb-4138-8a50-af1a54035d54","resolution":{"observed_at":"2026-05-22T23:37:16.406998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Concrete problems in ai safety","venue":null,"work_id":"23dc5a3d-dba9-432f-a2fa-1f0cda5f7fd8","year":2016},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:d58b13d7677526180c3632488751938255c2e773c84b417869ccc526272c5d8e","observation_id":"f3c48e26-a5c1-499b-9a92-0ad379b0609b","resolution":{"observed_at":"2026-05-22T23:37:16.522375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with a corrupted reward channel","venue":null,"work_id":"2390b416-01c0-402e-8d63-34dfad77772e","year":2017},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:a4b835dbd580c529b36dbc422c000619ff3c352c2da4c4662e227e35cbb67523","observation_id":"976fcbb8-c2c8-41c0-8565-87a155f023f8","resolution":{"observed_at":"2026-05-22T23:37:16.518183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specification gaming: the flip side of ai ingenuity","venue":null,"work_id":"ea75126b-38aa-432b-ad93-cec0806d04b3","year":2020},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:b770482fbf7aa37d5f0300d4f53cb7d9fe073a2aa90f1c2a9b222f2038a24857","observation_id":"55f8327b-5fd0-4297-b244-9ec0bff2eb58","resolution":{"observed_at":"2026-05-22T23:37:16.513859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward tampering problems and solutions in reinforcement learning: A causal influence diagram perspective","venue":null,"work_id":"a4fc118b-686d-4078-b461-b06bf0218a03","year":2021},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:3fe9fad9e6aed1fcb768224994b8f6847486a001b2bd23da3b5ebe33241707c4","observation_id":"2bad6074-0ed0-46ae-bd29-02b1d33a1ce6","resolution":{"observed_at":"2026-05-22T23:37:16.508996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"6a912ba2-d3e1-44d1-b18f-557836a8625e","year":2022},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:5609769052015bbed17c8f45d08eeafe2c8ac1ee458695c6e2503a075412157f","observation_id":"b090dab5-ae1f-4438-9355-0cf49c4b0c52","resolution":{"observed_at":"2026-05-22T23:37:16.504569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking in reinforcement learning.lilianweng.github.io, Nov 2024","venue":null,"work_id":"39f6c2f1-0b55-4a96-b398-8d21cd3ced05","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:da8c97702c6f54fd438dbc441d0f15be07b93473f79fa203e167b8731dcef33a","observation_id":"7f0532fb-c2af-498b-95e4-5e53f5f0cb4b","resolution":{"observed_at":"2026-05-22T23:37:16.500709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative language modeling for automated theorem proving","venue":null,"work_id":"40fc5229-637d-40c3-81d3-a2e76ed88ce4","year":2020},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:2af590a8a5fd79f04f024e16cce89959eb32bf7a9e6e5c21e3193b5faccf7e32","observation_id":"7f3f4976-6270-472f-a995-54cca691ac76","resolution":{"observed_at":"2026-05-22T23:37:16.497137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving olympiad geometry without human demonstrations","venue":null,"work_id":"4922f3b6-e336-45d2-bfab-ed28f7a7c3c0","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:ef10255ac713c21dad25324cba2f09316cdae66894159e6b83170f61a800d9e1","observation_id":"f776b224-262a-4ee5-ad22-abedf1d49b85","resolution":{"observed_at":"2026-05-22T23:37:16.493724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphageometry: An olympiad-level ai system for geometry","venue":null,"work_id":"8b221dc9-f64e-4142-98dc-413308c2ccd6","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:9477b152890ef6497b90674de1e32bb55a73d32baf9da17a3992f8b81a18c3b4","observation_id":"9671c03c-7442-49fb-a3af-3a94e31bcfb5","resolution":{"observed_at":"2026-05-22T23:37:16.489562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai achieves silver-medal standard solving international mathematical olympiad problems","venue":null,"work_id":"4338aec8-b428-4b37-b2f7-a7ad831a8c04","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:be188c9b59e6fec7a95b9c725dd10d57112b48b50ec42c1955c24e8f7aaf6d81","observation_id":"0c30b8fa-a4e9-4f5f-b6c1-e8f621a071bf","resolution":{"observed_at":"2026-05-22T23:37:16.485500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coderl: Mastering code generation through pretrained models and deep reinforcement learning.Advances in Neural Information Processing Systems, 35:21314–21328","venue":null,"work_id":"7f1857e3-599e-4e46-8b59-fbb9d4f98ac8","year":2022},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:3cb04825c7931f6217dfcd475ccefd686d22564c36e4c8a9d925cd48b6c82b1a","observation_id":"8c529730-701f-48a3-8912-a09bac9d6ae4","resolution":{"observed_at":"2026-05-22T23:37:16.481614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.379646Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"bfedec71-2ac8-4324-b509-1ef43efdfeae","year":2023},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:e38d231d7637dfd90f909c9cf3c1859b1e1b4b0f420387a41e62e26df108a3e5","observation_id":"abec4026-a124-4eb8-bfe9-ddb15ca94714","resolution":{"observed_at":"2026-05-22T23:37:16.477006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:54.675132Z","title":"Teaching large language models to self-debug","venue":null,"work_id":"a9fa7377-b715-4730-a958-acaeb2cac2f2","year":2023},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:1b22b61b9c4e93ca4da7ae0a28a9b6253d138345cdbd830939abc84bdb163e33","observation_id":"36a7154a-69cb-4bb7-9447-d47ad0bde6ba","resolution":{"observed_at":"2026-05-22T23:37:16.469675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning","venue":null,"work_id":"ad5fbe73-e5e0-4679-af51-369dc2c83fa8","year":2025},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:a2ead24a67b0875df3d747e85eec93c51efa428560af349d0181626788db2d03","observation_id":"e4f32f3a-dbf4-4208-8944-6ac7fc227847","resolution":{"observed_at":"2026-05-22T23:37:16.464115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:cb41468b0cc2d2d78b5eceefd6b910f9c4ecb5f3bd07dbfa60418ea9218c393d","observation_id":"fc980eca-952f-4e1e-b465-ddf65d8fdb91","resolution":{"observed_at":"2026-05-22T23:35:13.457464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"1c30f337-ae1f-4e46-961f-8d3635c6ab06","year":2019},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:00564ecce7ba52b3142251a9bd239ddca6f4b16533153fba9ad78cfe14b9b57f","observation_id":"14fda047-4c20-458a-a442-4e2da1a09b2c","resolution":{"observed_at":"2026-05-22T23:37:16.459927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First, note that the answer consists of an integer part and a square root term","venue":null,"work_id":"79cfa509-595c-4557-beff-7463d835e8a3","year":null},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:0262b024a1e5f234d57cc1e5aa1886d227d848d26927ad3e8d219d77ea9a5e9a","observation_id":"c51a8b68-f83a-4f56-99fa-7e5af95f863d","resolution":{"observed_at":"2026-05-22T23:37:16.456109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let B be the set of residents who own a set of golf clubs","venue":null,"work_id":"ba5bf9d7-fb67-41bc-981e-3bbdf8c3bb18","year":null},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:2347c8de0bda163b63faa670c9c56b0ecb8feee4fbdee161ce8126e246a59c5f","observation_id":"c0e2ce93-1364-4eca-9281-97cb2b63dad3","resolution":{"observed_at":"2026-05-22T23:37:16.451910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":27},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 100 inbound Pith citation observations for arXiv:2503.14476."}