{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe230cf6ecc5f6831f3083db6d0ac7a5f37c8bba1d4f42ae1c6aa9183527dfaf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:40:19.810322Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.773999Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T13:40:19.810322Z","title":"846903\"Output:304689 Example 2:Input:s =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21297","last_updated":"2025-05-27T15:00:57Z","snapshot_observed_at":"2026-08-07T13:28:17.822753Z","submitted_at":"2025-05-27T15:00:57Z","title":"rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.810322Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2505.21297"},"observation_digest":"sha256:c2c3d278c01cb25d6e4bb0a1e941ce1b02eeb7dd02e8a66b10507908fcc084ba","observation_id":"8fa0b0cb-40ff-44f7-9096-c22dd012a6ec","resolution":{"observed_at":"2026-08-07T13:40:19.810322Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T11:33:57.154091Z","title":"Xiaotian Zhang, Chunyang Li, Yi Zong, Zhengyu Ying, Liang He, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.154091Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:6e331ca0ac760f8a6f955839cf2f87e87eb51674bdd362752f55c98330d3a479","observation_id":"0550c118-947f-459e-bfbe-4a6c265c01e0","resolution":{"observed_at":"2026-08-07T11:33:57.154091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T00:40:40.069218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13066","last_updated":"2025-06-16T03:19:31Z","snapshot_observed_at":"2026-08-07T02:53:10.665842Z","submitted_at":"2025-06-16T03:19:31Z","title":"FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:40.069218Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.13066"},"observation_digest":"sha256:50775f348c8f4dfc5553b0ce8e5ad0c382b5d78d7fcdd00da6d8595cd5a70d58","observation_id":"824023c0-625e-448b-a72b-e5d5cb7d259b","resolution":{"observed_at":"2026-08-07T00:40:40.069218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T00:14:23.492554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-08T22:38:17.999204Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.492554Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:0ad6b30141b93d1a0f1a46f3c3d016b7cb6097a7e79a89e3679ca311477734da","observation_id":"cfda8c5e-4bc2-4b25-bbef-9a520947345d","resolution":{"observed_at":"2026-08-07T00:14:23.492554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T23:28:41.334745Z","title":"Wait”, “check","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18237","last_updated":"2025-06-23T02:06:04Z","snapshot_observed_at":"2026-08-08T19:39:45.470566Z","submitted_at":"2025-06-23T02:06:04Z","title":"AdapThink: Adaptive Thinking Preferences for Reasoning Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:41.334745Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.18237"},"observation_digest":"sha256:6870e1a3c036edadfa9ebd1f59f350c8c6ba0c1e0a29b8e57cc8f084d3020611","observation_id":"ef670f0a-6fbe-4d06-9322-eeac51fcc7e5","resolution":{"observed_at":"2026-08-06T23:28:41.334745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T19:07:36.624737Z","title":"arXiv preprint arXiv:2504.14286","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06573","last_updated":"2025-07-09T06:05:28Z","snapshot_observed_at":"2026-08-07T21:25:23.216182Z","submitted_at":"2025-07-09T06:05:28Z","title":"From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:07:36.624737Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.06573"},"observation_digest":"sha256:a8a7ffbc4f8cd4968a986b8c35409871846ed20550ca35c5949e70a333feb97d","observation_id":"3ee80aa1-e4b6-4d90-ba9b-0c678caca20c","resolution":{"observed_at":"2026-08-06T19:07:36.624737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T18:53:15.010459Z","title":"Srpo: A cross-domain implementation of large-scale reinforcement learning on llm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:15.010459Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:321e8eef63d87c889c2fd6abda118fd1bb6af406b7d09c5d4adf2a66dacfb316","observation_id":"588b069e-cf15-4971-b6ae-7fdd8a2ffc51","resolution":{"observed_at":"2026-08-06T18:53:15.010459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T18:28:30.436815Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08297","last_updated":"2025-07-21T10:37:40Z","snapshot_observed_at":"2026-08-07T21:25:45.428255Z","submitted_at":"2025-07-11T04:07:10Z","title":"KAT-V1: Kwai-AutoThink Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:28:30.436815Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.08297"},"observation_digest":"sha256:b4bad419bfea61d5ad0a4b5054db33c73a64780ea67832a4ce939ddd6d92c3ab","observation_id":"e16bb927-3e76-40a4-91cc-875e83af6f8a","resolution":{"observed_at":"2026-08-06T18:28:30.436815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T17:51:18.054670Z","title":"Srpo: A cross-domain implementation of large-scale reinforce- ment learning on llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09850","last_updated":"2025-07-16T17:16:18Z","snapshot_observed_at":"2026-08-07T21:24:42.345046Z","submitted_at":"2025-07-14T01:14:50Z","title":"The Challenge of Teaching Reasoning to LLMs Without RL or Distillation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:51:18.054670Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.09850"},"observation_digest":"sha256:e4f643431561fd596af1d1c73796fedd8a72d1a5d9ca8b7a203cd0995b44b850","observation_id":"b3ded519-52c8-419b-8937-bbaaa9dccd8a","resolution":{"observed_at":"2026-08-06T17:51:18.054670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-06T14:50:28.067043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17548","last_updated":"2025-07-23T14:26:58Z","snapshot_observed_at":"2026-08-06T14:43:53.674757Z","submitted_at":"2025-07-23T14:26:58Z","title":"CodeReasoner: Enhancing the Code Reasoning Ability with Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:28.067043Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2507.17548"},"observation_digest":"sha256:8bf8fc71e0e2c92917040b5a20d83fe6000c01a5e6ab849f651fdb776d663a69","observation_id":"01cf387a-dc15-4d58-9191-cbe4f1ed3b14","resolution":{"observed_at":"2026-08-06T14:50:28.067043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:cc16bf864fa73413ef8ece12fe30971ded719defbff6da1d602bd0550add1abf","observation_id":"5ff6a99d-6525-439b-bee4-924540413cb4","resolution":{"observed_at":"2026-05-18T19:21:48.803557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-04T16:07:47.154757Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":240,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:47.154757Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5e32994924ababacafdde7f4a47703604c5a043d1edbb8b1a87e1d0287fb9fd0","observation_id":"34d0a9c6-8d97-4206-9615-6b63681e28f7","resolution":{"observed_at":"2026-08-04T16:07:47.154757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-04T12:52:28.407488Z","title":"Srpo: A cross-domain implementation of large-scale reinforcement learning on llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01833","last_updated":"2026-05-25T18:23:42Z","snapshot_observed_at":"2026-08-04T12:52:24.589866Z","submitted_at":"2025-10-02T09:28:13Z","title":"Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:52:28.407488Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2510.01833"},"observation_digest":"sha256:9a5f9ba8ab6a51466285e272cc59ecd8f437ed957de819fe9825537bb66f9f4b","observation_id":"7fcae94b-67bf-4505-ae59-0626b50c976e","resolution":{"observed_at":"2026-08-04T12:52:28.407488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2510.18731","last_updated":"2026-04-29T19:05:29Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T15:32:26Z","title":"Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:04:10.226166Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2510.18731"},"observation_digest":"sha256:ec84e06df034d54e45b5d7ec67e67d55fc59c0e95fb7a9ca7ffa2431cd952c5b","observation_id":"86c664fe-99db-4d12-bcd6-9eed609058f3","resolution":{"observed_at":"2026-05-18T05:05:54.784655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2603.21440","last_updated":"2026-04-14T17:49:12Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-22T23:07:29Z","title":"KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T06:24:23.965754Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2603.21440"},"observation_digest":"sha256:56796d94aa301d045d899600bf345ba3588d35000c50007798ba2d023940ba33","observation_id":"bbee64ab-ad32-429f-a653-8048f268b749","resolution":{"observed_at":"2026-05-15T06:25:07.567438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-08T15:48:00.731292Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:d6fbf149564acfcc728f7a206c3b689deef016410444ba657b95ed4ad861b6bc","observation_id":"040d6b68-72c5-4668-9004-f56b942cb283","resolution":{"observed_at":"2026-05-11T04:00:55.027452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2605.11922","last_updated":"2026-05-12T10:36:56Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:36:56Z","title":"StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T05:27:37.521421Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2605.11922"},"observation_digest":"sha256:f6468e44ca27758848a2c9b71f0c2b227932349be1dd49c1e9705e45e2decfca","observation_id":"f0f34b89-99ca-49ff-8421-e1ce57ea0b24","resolution":{"observed_at":"2026-05-13T05:32:20.256262Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2605.17295","last_updated":"2026-05-17T07:14:44Z","snapshot_observed_at":"2026-08-05T14:05:32.700721Z","submitted_at":"2026-05-17T07:14:44Z","title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T15:11:43.235574Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2605.17295"},"observation_digest":"sha256:05b675e7218a07e18f85f35db78540267d07eed45d012cc5da477141d30bfdaf","observation_id":"8e9b1bbe-6e87-460d-b37f-80140c6a958c","resolution":{"observed_at":"2026-05-20T15:13:24.931997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2605.20865","last_updated":"2026-05-20T08:01:01Z","snapshot_observed_at":"2026-08-03T17:48:27.538608Z","submitted_at":"2026-05-20T08:01:01Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T05:55:45.654673Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2605.20865"},"observation_digest":"sha256:02e02a5ed6cebf78cb692639402249a7f5a64d46c0597e9e44fba8effbf28cf3","observation_id":"6929a437-184e-42fc-852b-7815e614f977","resolution":{"observed_at":"2026-05-21T05:59:41.075776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:a91d9fe2cd76bc4696597380225e3b4950c886be5843f895e054f4212fc4462e","observation_id":"d2ff5de9-1909-4aff-841b-382f44db42a0","resolution":{"observed_at":"2026-07-01T21:16:13.400279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2606.06828","last_updated":"2026-06-05T02:07:08Z","snapshot_observed_at":"2026-08-04T19:25:01.419366Z","submitted_at":"2026-06-05T02:07:08Z","title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T22:54:21.740892Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2606.06828"},"observation_digest":"sha256:e964161fca637dfebe9ef30e19db9583eb53b8a2d0233a495775597a078abadf","observation_id":"33ec4857-2c52-4929-896a-e3658182a151","resolution":{"observed_at":"2026-07-02T16:17:08.889756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T13:55:35.363377Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2606.11119"},"observation_digest":"sha256:3404ba112e4d40988f218bdd116df2c36a41176cda273af0373a2b2949a74984","observation_id":"f659790b-0b17-460e-a7b4-f359adc99aca","resolution":{"observed_at":"2026-07-03T04:27:36.775325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-01T00:29:00.841014Z","title":"Srpo: A cross-domain implementation of large-scale reinforcement learning on LLM.arXiv preprint arXiv:2504.14286,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.841014Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:3ecdc1c3babd3bcc1484f8cc29c08384237147b0b19d8ae3676bd8e9ca4fafa6","observation_id":"0721e090-647b-4ff0-8756-616091f58f48","resolution":{"observed_at":"2026-08-01T00:29:00.841014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-30T18:55:22.314325Z","title":"arXiv preprint arXiv:2504.14286 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26862","last_updated":"2026-07-29T12:45:55Z","snapshot_observed_at":"2026-08-05T12:59:07.641970Z","submitted_at":"2026-07-29T12:45:55Z","title":"ReCo: Reweighting GRPO Against Distributional Concentration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-30T18:55:22.314325Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2607.26862"},"observation_digest":"sha256:5a3f186f0ba2b30175dd2dfc622456c3b68cb362d467ca27705cc398c657a9ea","observation_id":"ed222e3f-3531-41b9-ac31-46ac4fb7ef93","resolution":{"observed_at":"2026-07-30T18:55:22.314325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14286/citation-record","integrity":"/paper/2504.14286/integrity","json":"/paper/2504.14286/citation-record.json","paper":"/paper/2504.14286"},"outbound":[],"paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2504.14286."}