{"as_of":"2026-08-19T23:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6788ca765769f304336783e6b95afb4c8c849dfa1e669fdad23be7d44d26cd07","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T20:52:33.620041Z","state":"measured"},{"denominator":134,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":134,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:46:57.916405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-13T10:15:00.293616Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T18:45:16.641012Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2505.05470"},"observation_digest":"sha256:603cca46975b616aaa0fd23005f59a5659cdf666a3399a9a18f009e1ec15fcf2","observation_id":"2992c4e0-dd2d-42da-8445-a7a0f67d9f0e","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-07T05:01:19.371511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08927","last_updated":"2025-06-10T15:51:16Z","snapshot_observed_at":"2026-08-16T18:49:11.556043Z","submitted_at":"2025-06-10T15:51:16Z","title":"Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:01:19.371511Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.08927"},"observation_digest":"sha256:6c2ef67eb00803a8a3f41d8e17de51ac517832a079ab1b9eeb3bb88da4882ea9","observation_id":"6535f3c3-f3f3-410c-addb-de6dcf3795fe","resolution":{"observed_at":"2026-08-07T05:01:19.371511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-07T05:03:26.538629Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-18T17:39:46.587540Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.538629Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8333a2d4ecd4ac9055a8b48af86521ed0d569711058ee9643d3c7e17833265c1","observation_id":"cfe38482-8f06-465a-97f4-0d92e1ae9e09","resolution":{"observed_at":"2026-08-07T05:03:26.538629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-07T00:41:35.394606Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-13T16:04:27.350434Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:35.394606Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:cca2f01806fcbb2d959b8f179cd7af1de480df36d43bc4a51407f92cb7009700","observation_id":"9945ac94-99ee-4cd5-bc09-518bca2d4311","resolution":{"observed_at":"2026-08-07T00:41:35.394606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-15T18:46:57.916405Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-18T05:00:38.487483Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:57.916405Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.18880"},"observation_digest":"sha256:c76e3053da1fde2da66395fdebd0539df594b7e4aac03aab1fff88ee096d5008","observation_id":"fb35d26b-a10e-49c6-a693-7e217cb88bdb","resolution":{"observed_at":"2026-08-15T18:46:57.916405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T22:52:33.390202Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20639","last_updated":"2025-06-26T15:46:40Z","snapshot_observed_at":"2026-08-19T21:26:16.218628Z","submitted_at":"2025-06-25T17:35:47Z","title":"DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:33.390202Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.20639"},"observation_digest":"sha256:8c4d4eeb1ee8e847c5e6dff4f42ad3bbfebbc0a86db8a047500c7c5a646756b8","observation_id":"f20fba18-42b1-4061-b4f8-a82e513065ec","resolution":{"observed_at":"2026-08-06T22:52:33.390202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-15T15:20:51.338738Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:775bcfab093121abada8a55b6c5a9aa518c88863b5ab0f8dc6e72c673dfc70c4","observation_id":"eae0d52c-25d5-417a-9a7f-e699cecff859","resolution":{"observed_at":"2026-05-21T23:40:46.416012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T19:14:17.317668Z","title":"ProRL: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06181","last_updated":"2025-07-08T17:03:39Z","snapshot_observed_at":"2026-08-07T16:09:15.554628Z","submitted_at":"2025-07-08T17:03:39Z","title":"CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:17.317668Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.06181"},"observation_digest":"sha256:0073a159a6e54d212fdac658cf02309d61cfe8bd59889c75398c62eaf901f8b6","observation_id":"fd7fd3a8-3250-479c-9eee-d7e955d58426","resolution":{"observed_at":"2026-08-06T19:14:17.317668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T15:36:05.421844Z","title":"ProRL : Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15507","last_updated":"2025-07-21T11:19:04Z","snapshot_observed_at":"2026-08-12T15:30:56.747233Z","submitted_at":"2025-07-21T11:19:04Z","title":"Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:36:05.421844Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.15507"},"observation_digest":"sha256:c3dd4592001c2a2323107907d346e8fb1484ae2505d97a0d9386d41ba909bebe","observation_id":"da5b0f7a-d27a-42ab-b494-5c6f70157773","resolution":{"observed_at":"2026-08-06T15:36:05.421844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-14T07:39:12.121905Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:53702d50fbc4c83c560cf8d2bab39db9c120637a693f5f80b1f66ca714b864b5","observation_id":"0a4edfb0-8eae-4bc5-b7ee-22f942df262d","resolution":{"observed_at":"2026-05-21T23:24:26.257703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T15:20:14.585900Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16331","last_updated":"2026-07-03T09:17:03Z","snapshot_observed_at":"2026-08-15T12:22:31.317936Z","submitted_at":"2025-07-22T08:13:01Z","title":"Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:20:14.585900Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.16331"},"observation_digest":"sha256:6f1364ee68dda0a496405c0091f247fb983c46f3a13ad2ad4fdaa55fe5acb38e","observation_id":"1cd65a90-dbba-4744-bbdb-cdc1931fba4c","resolution":{"observed_at":"2026-08-06T15:20:14.585900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T14:53:04.512694Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.512694Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:bbbefbdb94fabc6f8e647f15ea968f82f50cf43d3ece3ea4faff0857b3f575f5","observation_id":"3dd56042-bd00-4b39-9500-092af60b8646","resolution":{"observed_at":"2026-08-06T14:53:04.512694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T23:43:04.044724Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-13T14:44:21.373438Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:04.044724Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:80faa742967c002c85a4090953daf622e4af11a1567080da485412e0b2cd2a90","observation_id":"9a4b9eac-311d-45a1-96ca-8af558b20872","resolution":{"observed_at":"2026-08-05T23:43:04.044724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T22:03:28.116441Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.116441Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:5614910bd147138d4977809a962a726fc6787241f82ab99ede3ca03b5058e474","observation_id":"0b894881-4190-409d-9d68-3950e4797a83","resolution":{"observed_at":"2026-08-05T22:03:28.116441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T20:21:07.634233Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.CoRR, abs/2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-18T20:12:03.334534Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.634233Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:bc396fdc2fe65872349d7f880f94f9ccbef98a9961a02ca1cd384939d07fd7ca","observation_id":"de686465-cf53-4b9e-89c3-2a3fdf6af3de","resolution":{"observed_at":"2026-08-05T20:21:07.634233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-15T17:36:21.460084Z","title":"Hugging Face repository, 13:9","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11016","last_updated":"2025-08-24T13:33:47Z","snapshot_observed_at":"2026-08-19T07:13:32.342460Z","submitted_at":"2025-08-14T18:40:34Z","title":"CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:36:21.460084Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.11016"},"observation_digest":"sha256:075ce6e35189d264acb6680fe557729c31a7407f6c793a091fbe63a51ae74502","observation_id":"71057d06-6966-4285-b979-283f21bb2a11","resolution":{"observed_at":"2026-08-15T17:36:21.460084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-08-04T09:31:07Z","snapshot_observed_at":"2026-08-07T23:09:05.524726Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:a3dcfa202b245a30060d9f3f964744cc94cb7eed2402f5410264b51cdc995c6a","observation_id":"55cc0bf5-2d45-4161-b7db-c60155982b52","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T14:57:39.432202Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-14T18:22:45.199437Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.432202Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:d71f658d751cdb3bbe1398fa99cb13faa014cffe2c9315b8183ce9e7f053a768","observation_id":"aa9b1cef-8270-4200-9f95-350fa9bf2956","resolution":{"observed_at":"2026-08-05T14:57:39.432202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T11:39:23.530235Z","title":"Prorl: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.530235Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:37ad020901266df8e2a37a772ced3a107d46641fc3265fc700f4b1319b13c350","observation_id":"185b89bf-3df2-45a3-ada4-b3de776752b5","resolution":{"observed_at":"2026-08-05T11:39:23.530235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-15T16:45:52.833521Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-19T08:01:14.590266Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.833521Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:5b2a4f2bde258313ba39e493616cfc71cd8da1b09c2671bf59f3e71ab52ad8c3","observation_id":"7031dc5b-c461-444e-a4c3-f9889dbcefcb","resolution":{"observed_at":"2026-08-15T16:45:52.833521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:1d4f3aa4819d9b8bb42b095d714f7bd2735c05bca436091a05a2b615e6d20179","observation_id":"c5a2fb91-77c4-41df-a9a1-7264959a1673","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-15T16:37:52.919834Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03059","last_updated":"2026-07-26T23:59:38Z","snapshot_observed_at":"2026-08-15T17:21:39.654535Z","submitted_at":"2025-09-03T06:42:40Z","title":"Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:37:52.919834Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.03059"},"observation_digest":"sha256:3f3787a0059ed227cd8942d7cd66a20a337592dd40f658200345717108517fab","observation_id":"b6ae3d25-f8a1-4a16-9eda-4c4e34c279a1","resolution":{"observed_at":"2026-08-15T16:37:52.919834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:f62c88c15585a589cc3a748bb3b7b73b6274da6eb2298c8903fc1231973747e3","observation_id":"e5c41cfa-13ad-4851-be0c-ddde473625ce","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-04T16:07:34.887140Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:34.887140Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5643cdf145f28a483e31b1e7fe4efeac6fae461fae541a15cd22f34666e7ce3f","observation_id":"ed1f0e17-23bb-40a1-9489-9665a333a24a","resolution":{"observed_at":"2026-08-04T16:07:34.887140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2509.25454","last_updated":"2026-04-06T19:16:24Z","snapshot_observed_at":"2026-08-14T01:37:27.619893Z","submitted_at":"2025-09-29T20:00:29Z","title":"DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:12:25.437344Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.25454"},"observation_digest":"sha256:b51e604d694bb678e23ef119711940e09582d4878e3d8cbb46bb175c8d5a850d","observation_id":"753d33ce-83a0-434f-8b0c-52661879e75f","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-08-15T14:36:41.242147Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T20:29:25.874620Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.06062"},"observation_digest":"sha256:9a74f703fb18ac846938dcb2c812ee1987448044dd30b6771dfb7549a52067e7","observation_id":"9619e9b8-149d-40fc-b8af-29a8728bebe8","resolution":{"observed_at":"2026-05-21T20:30:35.530451Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-08-16T12:08:41.734241Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T07:37:12.501489Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.10150"},"observation_digest":"sha256:728eb6cea709d7cbd7caffdb54c02306a0b5c6115a169d76d6461b9a9bf190be","observation_id":"20c5a131-08e4-4437-a6d9-a166faa0df27","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-04T10:09:02.979065Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-17T11:14:49.883191Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.979065Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:e6691ee8e7557d21eacbc5af11361d5d4f61fa44997bea990107b7cfa4703f4e","observation_id":"8768ed37-c50e-4366-b06c-99eaf0815fb1","resolution":{"observed_at":"2026-08-04T10:09:02.979065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-18T16:44:13.851821Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:0eb60f78a314de1aa7c3c45da2449ebe72c1cf70e3b4d6f2af0d844ca4ec8a2a","observation_id":"150fcd04-9d9e-427d-9dba-c88f8f72ac38","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-04T08:15:53.349181Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-13T02:25:37.938690Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:53.349181Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:df46dd41a8aa8461ef4562ffd9682ccfaaa468ada8f2e2790ecbe79805aa7010","observation_id":"bac8f873-8339-4a8f-9c0d-b90c6164c2da","resolution":{"observed_at":"2026-08-04T08:15:53.349181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-03T23:08:07.481047Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-17T15:49:29.725107Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.481047Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:adac61c1bf9d93ae73b11bdfc3d57b67ed414c0d5d1e8d8fc2767a60f9bfdf81","observation_id":"f8b28bf1-c0ac-4f36-805a-8d86fc864981","resolution":{"observed_at":"2026-08-03T23:08:07.481047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2512.05591","last_updated":"2026-04-23T12:00:34Z","snapshot_observed_at":"2026-08-17T12:20:40.125534Z","submitted_at":"2025-12-05T10:26:32Z","title":"Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T00:53:51.251900Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2512.05591"},"observation_digest":"sha256:1ea9d61f2ad6d70d90f6e53b5ed74e9e323b9e97a077178aec3cba5ebb5ee96d","observation_id":"fd087267-0ab3-4580-ab85-1469ec6bfc2b","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-03T11:13:16.861548Z","title":"Prorl: Prolonged re- inforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-08T14:41:26.174719Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.861548Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:8538d1adb0d7a273478fa1435efddd28a8e55b922bdf9be65f5520edde0f5e3f","observation_id":"19cb6ca4-e3c7-42a9-886a-29c14fdec193","resolution":{"observed_at":"2026-08-03T11:13:16.861548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-03T09:03:18.768478Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15165","last_updated":"2026-06-08T15:43:52Z","snapshot_observed_at":"2026-08-16T03:35:41.734035Z","submitted_at":"2026-01-21T16:41:58Z","title":"The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T09:03:18.768478Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2601.15165"},"observation_digest":"sha256:aab4ff131c9060b04feabe5138ab6b3d97fc0c30a53cf266f1ab9081b472770b","observation_id":"f81db7c7-8ba2-4c8a-910f-01f72ebd2662","resolution":{"observed_at":"2026-08-03T09:03:18.768478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2601.20829","last_updated":"2026-05-09T10:47:17Z","snapshot_observed_at":"2026-08-16T03:14:48.033073Z","submitted_at":"2026-01-28T18:29:21Z","title":"Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:26:45.961575Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2601.20829"},"observation_digest":"sha256:b57e6c7278b03b581ef5c52adb90803214702b0d71a8b0447e0625d6aebf5e57","observation_id":"839e7f3d-c551-46b8-96f9-79f52ad59d89","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2602.01970","last_updated":"2026-05-15T12:23:06Z","snapshot_observed_at":"2026-08-18T19:27:56.462164Z","submitted_at":"2026-02-02T11:24:36Z","title":"Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T14:09:26.842696Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2602.01970"},"observation_digest":"sha256:7f366ff032b82d2fa97dd6aeb06b129be60fe07801716841f366ad89b043a9f0","observation_id":"23075704-eeea-47cc-b239-ed2782eeeeb0","resolution":{"observed_at":"2026-05-21T14:10:13.046565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-02T23:11:55.011109Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-15T22:28:45.285943Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T23:11:55.011109Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2602.14872"},"observation_digest":"sha256:a4d547024ce1ec0a4a2b30477c682b14fd8c73cb7bddcac807b5c8b4cae4f1e7","observation_id":"91d121ed-b446-499c-8dbd-dc90fbd3dc0c","resolution":{"observed_at":"2026-08-02T23:11:55.011109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-17T23:10:58.941065Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:4fd60341a8388420c12e59087c4126e46052bd34249ca27bef9b653443dba20c","observation_id":"4bfa553f-d1b8-4998-8295-0797b2c3c779","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-07-13T14:28:35.916911Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01301","last_updated":"2026-06-09T22:21:28Z","snapshot_observed_at":"2026-08-13T11:08:33.154775Z","submitted_at":"2026-04-01T18:05:32Z","title":"Numerically Optimizing Shortcuts to Adiabaticity: A Hybrid Control Strategy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T14:28:35.916911Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.01301"},"observation_digest":"sha256:f8377a7f1c9534691492766c2a4be05a7dec12629cdcbdbdc204dd679e3fb752","observation_id":"b34124ea-dc9e-4db3-9eb5-0a692f4ec903","resolution":{"observed_at":"2026-07-13T14:28:35.916911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-08-17T01:30:48.433848Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:c6d1bde6734beba6abcb37fce67d1d8f876861e617096a0f442875400191627f","observation_id":"3bd4f56d-4dc1-463d-9567-a72a04affa89","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-14T08:41:23.060090Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:da018adc1559c4ce927ec5075e1112ea20c838d5b6f2682c46ee3f7da54f0ffb","observation_id":"03a8463b-9a94-4055-8605-f1a3cbbc8500","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-08-14T00:24:03.820656Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:890c80f2c355189d7e1c52c86cbaa58dcc4ad1ef063e697cff43148d41ec77c2","observation_id":"d5663aad-3b44-4559-b8d2-59f0324274cf","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2604.17931","last_updated":"2026-07-01T16:44:57Z","snapshot_observed_at":"2026-08-16T15:24:48.776160Z","submitted_at":"2026-04-20T08:11:09Z","title":"LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-05T15:03:50.420072Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.17931"},"observation_digest":"sha256:ae4038aeaf5f388af4d09c84d9067706ff748fca3b66e64a27c13eaabaa2f733","observation_id":"67539e43-f4b6-4bd8-a62c-aea2828bf0e6","resolution":{"observed_at":"2026-07-05T15:11:10.854096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.08686","last_updated":"2026-05-09T04:51:42Z","snapshot_observed_at":"2026-08-14T11:24:29.349112Z","submitted_at":"2026-05-09T04:51:42Z","title":"Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:10:03.459912Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.08686"},"observation_digest":"sha256:91cabeece627c8aa6a68eb8a0825e6223090337655f72e2beaf778c33f61e235","observation_id":"f0b0da62-cbde-4ef9-a153-fc8902bd412d","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-08-14T22:16:49.341698Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:57:30.877915Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:870aa8266c261ce3ae1faf1f8bed614e9741044c55516aa1f49cbbf0323e9f74","observation_id":"849fb43e-80fd-4b73-9eb0-8242fbb32d33","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-08-14T22:16:49.341698Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:1541f6dcf5746823829f20098baeeb6cd4eb99325925e58ed01c1b1d679d76ce","observation_id":"844b31fa-83ab-44a1-8b2e-f7d5ebd5d7fd","resolution":{"observed_at":"2026-05-20T22:49:10.664024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:2db204bbe3e26cc9f9e9c77a0cb62cfb4bb13d2919b55b0b534b0bba64c28ea4","observation_id":"79c5031c-f0ec-4fe3-9a85-60c213abefb0","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-08-12T20:17:56.417016Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:9afe2fe925d0be37e3042adb0421cac16062609a307a2640c5f6475979568119","observation_id":"8046a357-0c77-4e27-bfa6-a6774ffc35ed","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.12112","last_updated":"2026-05-12T13:29:10Z","snapshot_observed_at":"2026-08-12T16:04:04.492089Z","submitted_at":"2026-05-12T13:29:10Z","title":"When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T05:50:13.653022Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.12112"},"observation_digest":"sha256:e9c11cfbca89d988f769aac87323516824ba47af69a0d396c66271a78b01a719","observation_id":"407e4e2c-5068-4de7-ae40-e55547c2d641","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.15726","last_updated":"2026-05-15T08:22:59Z","snapshot_observed_at":"2026-08-15T14:05:20.816227Z","submitted_at":"2026-05-15T08:22:59Z","title":"Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:18:52.845177Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.15726"},"observation_digest":"sha256:9bca950aacb86b2a1b7645af3a30d5965416601ab926675b67403484fc73d0ae","observation_id":"16cd8fdc-8158-4c29-9b74-d5e80f31b0cc","resolution":{"observed_at":"2026-05-20T19:18:54.379011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-15T07:51:33.452820Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T08:10:14.041279Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:9413faccffa3507f6aec7681e7fb97692420ce6b51f87e71430b32778fb8febe","observation_id":"c1d5640c-0a04-4079-85cc-f7cb910bdb2b","resolution":{"observed_at":"2026-05-21T08:14:03.312265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-15T07:51:33.452820Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:dddfcbd54bed8c7cc0e006c6606fa894f913a25c9bde1e0e4ec12f5d807d0ceb","observation_id":"05bf0cfb-0094-4d53-977e-58f0dab65e35","resolution":{"observed_at":"2026-07-01T14:55:48.267554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.31058","last_updated":"2026-05-29T09:29:32Z","snapshot_observed_at":"2026-08-16T10:02:12.260939Z","submitted_at":"2026-05-29T09:29:32Z","title":"Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:08:05.597810Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.31058"},"observation_digest":"sha256:de28eba08774ffa905eb8bab53d6f67b5a2ccca0df7ee2aa8498875c2a40f67f","observation_id":"649240f5-9b95-4ceb-a52d-9f92302ee866","resolution":{"observed_at":"2026-06-28T23:12:47.100067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:a18623244341eb5708a8b9cc07794e50023f420c2b1769160566bdcdef27660a","observation_id":"818e8dfd-a375-4be8-b94c-906bad8d0842","resolution":{"observed_at":"2026-06-28T17:22:24.820455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":225,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:67354318ef7c69f6397e88dab835cab521abfe31f299c1c1c974064bc6fe4627","observation_id":"74d0f968-bad8-41f0-ae77-f77721cb68cd","resolution":{"observed_at":"2026-07-01T20:56:13.555191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-19T05:16:52.771821Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:47139dfd1a4997f4fb7a2003dad06d8cd1755ef4fa1c68246a5d90954053f152","observation_id":"92d3cf5e-fff5-4c56-872e-5a3bdd08238e","resolution":{"observed_at":"2026-07-01T21:16:13.376818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-08-17T12:12:16.054040Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:1fa974787b83fb735d848de636a7353dfd61f54bf72933bbc8aab4fd0960d22d","observation_id":"ee6a4c90-954b-4c34-bb64-172387919d13","resolution":{"observed_at":"2026-06-28T01:11:28.844134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.07856","last_updated":"2026-06-05T21:37:49Z","snapshot_observed_at":"2026-08-17T05:33:32.633439Z","submitted_at":"2026-06-05T21:37:49Z","title":"Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T22:26:50.223393Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.07856"},"observation_digest":"sha256:e52a59df469591ce30066448935b6f43a6a419a61550741d34f2d7b42f9f3937","observation_id":"84a3e069-37aa-4a20-9957-5255bebcc66f","resolution":{"observed_at":"2026-07-02T16:47:09.127737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-08-18T17:54:27.819254Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T13:55:35.363377Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.11119"},"observation_digest":"sha256:9cfc678ef04ea6c55319435aab556d5b58f8d2f6fefbfcef4331b50e47cf782b","observation_id":"2b9d8924-e10e-4c4d-885e-763294d3745a","resolution":{"observed_at":"2026-07-03T04:27:36.689469Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:2374b20472adb533431b0b1daaab015a9a6f2437052203736128263d92b0bc1f","observation_id":"940785f6-1537-4491-92c1-fa81b0913bec","resolution":{"observed_at":"2026-06-27T01:20:20.555477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:5a5671816a001c30badf2aa65d618cbd291ad81c534a634236306aeeded57092","observation_id":"a8904ec3-a755-437d-a82f-547e68bfb96d","resolution":{"observed_at":"2026-07-03T20:48:56.207246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2606.18284","last_updated":"2026-06-10T02:04:29Z","snapshot_observed_at":"2026-08-14T01:56:24.853455Z","submitted_at":"2026-06-10T02:04:29Z","title":"Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-27T10:36:09.211639Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2606.18284"},"observation_digest":"sha256:d7290d413b554a6b90c50d0fd888bdb8b4f16fc33a8cc036029f7696b611469a","observation_id":"5793ee26-189c-44b3-8447-eb8716704650","resolution":{"observed_at":"2026-07-03T08:57:48.118568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-08-15T03:32:00.182027Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:c7fa869254df986a06ac65b34c76bcb5d060833b920a2374d336c3c87674c394","observation_id":"f5c25b2d-c968-4333-b469-e58d2bcee014","resolution":{"observed_at":"2026-07-09T04:05:55.490553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-02T06:37:38.160357Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-15T14:50:02.087485Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.160357Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f8c50760313cd236aa273b773c135421a6df2aabfce117e649f2f352c593c5e3","observation_id":"99c812be-c174-4e18-a448-0094ca043f57","resolution":{"observed_at":"2026-08-02T06:37:38.160357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-01T12:52:00.138146Z","title":"Prorl:Prolongedreinforcementlearningexpandsreasoningboundariesinlargelanguagemodels","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-12T03:54:08.027598Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:52:00.138146Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:2f8f55dc1777fc49e99242deb03449a26adf0f32d0dc7fcaa6076e862f3ce249","observation_id":"486c41ab-4829-414a-898a-1eb672dc75eb","resolution":{"observed_at":"2026-08-01T12:52:00.138146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-01T00:28:59.796151Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-15T21:06:48.998264Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.796151Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:ce0fcecd1e623702b7461b4f6ac7cc9eeb580eb8373ab6709c0886a63bc5db1c","observation_id":"03a342d7-a398-48f5-8ca1-385ab2de3150","resolution":{"observed_at":"2026-08-01T00:28:59.796151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-07-31T01:31:11.492967Z","title":"arXiv preprint arXiv:2505.24864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-18T07:57:19.623144Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.492967Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:eda56699b5af02730649bf7877901f8f9dd0ffcb647168327aa16c66e06e9390","observation_id":"7df0f2db-156f-4f71-9816-5ef0710f6e4a","resolution":{"observed_at":"2026-07-31T01:31:11.492967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T00:08:25.365379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01522","last_updated":"2026-08-02T22:19:01Z","snapshot_observed_at":"2026-08-15T16:34:06.458991Z","submitted_at":"2026-08-02T22:19:01Z","title":"Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T00:08:25.365379Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2608.01522"},"observation_digest":"sha256:a92029c6aa85ecbe373299a56e53e571fc6cc48193321f744b8e00e3a65941af","observation_id":"4dcbe759-1785-4b01-93f2-7865b7afdc9f","resolution":{"observed_at":"2026-08-06T00:08:25.365379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-11T10:32:12.916702Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.CoRR, abs/2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.916702Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:2b144ed94054b000ef1532b8159436bede8871f058ce88fc9bcc167b011d546c","observation_id":"469e5597-9969-4364-bdd8-aefef327d7dd","resolution":{"observed_at":"2026-08-11T10:32:12.916702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24864/citation-record","integrity":"/paper/2505.24864/integrity","json":"/paper/2505.24864/citation-record.json","paper":"/paper/2505.24864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:f5fe0ee5094b882030e5b832e5aa75087682d3ec98ee199aa9e1de9f6eb3589f","observation_id":"db55c592-fee7-489c-917f-8a715bd1b81f","resolution":{"observed_at":"2026-05-18T20:52:33.737148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:28cade4cfc1062b7d435f265c7ed9625e8fe2987833036e8930655305d13d2bf","observation_id":"0064d6c0-ef0b-4571-b920-68cd5c3407bf","resolution":{"observed_at":"2026-05-18T20:52:33.724965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"6d310c99-1234-41ab-a652-d6300d92a5f7","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:a2939c96b16a732caa2345ee9601a03be2def0ce27c50e40b452373605a65e79","observation_id":"fe294fc9-23aa-471b-be50-bca517e8ecf6","resolution":{"observed_at":"2026-05-18T20:52:33.942017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":"0cba1d96-9f7e-40b6-999f-9c62b06a0829","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:959b741283f09e1f8c2f85d0ef2ae085da28abae6b67f085a7a035c4c4535ac0","observation_id":"60023cbc-ca21-4ba3-8268-b2039fe12f5b","resolution":{"observed_at":"2026-05-18T20:52:33.945910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":"835050a9-e379-4e8f-a7f0-2f3361f2511f","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:e903b73bd63761b7d474bdf6052d4142665d07ef97e996af9e81c3b8c075536a","observation_id":"78dc3227-3d7b-4b4b-8625-fa8c2ce84328","resolution":{"observed_at":"2026-05-18T20:52:33.949604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":"252c3cd0-19dd-4882-8743-2d115656614b","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:2110897dbc08239b2563c1d861306ce3088e03a53de218280753f4dab6c201f0","observation_id":"26154e3d-2f9e-49bf-8b85-972a14d5fbd6","resolution":{"observed_at":"2026-05-18T20:52:33.953023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":"ec8370e7-2665-4998-a4e6-382559b4c477","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:4d5976833207b688fda58eb59bb96fb9cd393ace2454052a7e5a07f6c68b18bd","observation_id":"32789a36-fa2d-4743-bda5-459f1daaa73e","resolution":{"observed_at":"2026-05-18T20:52:33.956593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:25:03.930996Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":"b25e90fb-173a-4c53-8e7d-dd60c163b55d","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:8318a8557c1bf2450c1220b3fa34a630d4f0a216a23ec5e82df49cc29684dda3","observation_id":"8da7fc17-dcab-46f2-9cdc-dd5cbbd752b0","resolution":{"observed_at":"2026-05-18T20:52:33.960415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:7570b521e1ff9ad936be1935443acc1875c5c45922501c0278ffefa3912c6a50","observation_id":"26f2d617-b911-4953-83c6-a852e7f74399","resolution":{"observed_at":"2026-05-18T20:52:33.694039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward hacking in reinforcement learning","venue":null,"work_id":"a4466ed1-fea7-4985-8d63-e966f501b533","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:207e1a8a0816df6de5f2453489c879197b17b18adf0a511aeef6e31109c6c237","observation_id":"778cbe5b-0bdc-498f-8034-e4b8237e28b7","resolution":{"observed_at":"2026-05-18T20:52:33.963310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-08-17T15:42:49.103733Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":"2409.12822","doi":"10.48550/arxiv.2409.12822","metadata_source":"pith","pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language models learn to mislead humans via rlhf","venue":"cs.CL","work_id":"4e7ac831-1344-4b1d-910b-7698f7d1c019","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:a1704d29683cfebe26bf45c34558faa784b754a9480fa28a4276442836cd5a73","observation_id":"e03fd634-d6af-4fc2-bc8c-b5d0a3ede3ab","resolution":{"observed_at":"2026-05-18T20:52:33.686569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai as humanity’s salieri: Quantifying linguistic creativity of language models via systematic attribution of machine text against web text","venue":null,"work_id":"9eeee7b2-aebb-46a9-b8fc-51301f8a4dda","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:25f8f90156447ad6532d86af64d3b176c77e6ba3ee546330239d92ce264b708a","observation_id":"6d433f32-0dac-46e1-92cc-be5f136bd599","resolution":{"observed_at":"2026-05-18T20:52:33.966236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?","venue":null,"work_id":"9b663197-6f5d-41fd-bacd-5870161f928e","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:d0d0ed65dbe8d77db72676a63a5e7d3308eb77b2d38afef6f637a1890dee6677","observation_id":"5838bba3-2103-4dd2-84e2-86795e131750","resolution":{"observed_at":"2026-05-18T20:52:33.969536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zico Kolter, and Aditi Raghunathan","venue":null,"work_id":"b58a3727-5cac-4ff9-a916-e2b70a61fd7f","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:d34dee5bc09cb716d6a7b59c5c11088d6113927aa618367e6efb9f067a2441ef","observation_id":"048a6162-14fa-4d30-b7fb-99493383e734","resolution":{"observed_at":"2026-05-18T20:52:33.742234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":"efbd78c7-2b5a-4a69-a6a7-a2cfd0ccacef","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:162a7f2277beaebdec410f604b381eea53f327f73bd4a6ed9fc42db7d05d441c","observation_id":"0a4f8708-77ed-4e95-a57e-adc1e70dad1f","resolution":{"observed_at":"2026-05-18T20:52:33.746777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:e944ee234c4ce3c799b0e3c4345c5c4aa9fa389b94a4a709b7810b294979ed8f","observation_id":"c014312b-3f37-474a-a862-3c91589e9c6a","resolution":{"observed_at":"2026-05-18T20:52:33.705777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:06:10.239871Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"3fd006b3-ce9f-4777-887c-2e1b5edfdf04","year":2017},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:72d485226901d26d7f7a7db00607a1bc852449fcb96c5d787b3958bc6da08a6f","observation_id":"32b866aa-1325-4416-9ff9-42a67780c45d","resolution":{"observed_at":"2026-05-18T20:52:33.751463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skywork open reasoner series","venue":null,"work_id":"ac1decf4-b429-4e11-925f-c7ef8649c11b","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:777119dd058648edbb5a8abc80bb8a5369e7d36a7cc0553689f708aa078e9826","observation_id":"c29eb7d5-5b95-4c6b-b1a7-ebf6863e36db","resolution":{"observed_at":"2026-05-18T20:52:33.755535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"6d1b4008-be50-4dae-b88f-d2c82e7ec94a","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:13f76be122179214646ee099d2cbd26888ba7b91c5feb4d3e754551e75a6850f","observation_id":"a6e6dd55-2273-4630-9067-7ca35653cae1","resolution":{"observed_at":"2026-05-18T20:52:33.760509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:42:26.502375Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"32b6dc59-5f3c-43d3-beca-d7f40277af3d","year":2019},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:2cd007de4459ac3615e6535a3bcd4d28306b607b61e9f83537ae1d0d598362df","observation_id":"c1356bb4-87b9-48a0-8078-329a91fad184","resolution":{"observed_at":"2026-05-18T20:52:33.768334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient","venue":null,"work_id":"18772931-c0f8-4b45-bbb2-eb3f626eb2ee","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:61873f4b87b0384d842ae02c90a084a0d3dfa1bb5242ecbb488c7d5d00c24e01","observation_id":"a664540d-7487-4b8d-8502-cf019f896747","resolution":{"observed_at":"2026-05-18T20:52:33.772425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"8e039268-0e3f-49db-8f7d-9d9c6a20090a","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:b705ae71cf0f8fabda3f4e11a8ce6df9f4841a8f017a0081363e80868639949c","observation_id":"032fb386-a6fa-4320-b3e0-463613682f23","resolution":{"observed_at":"2026-05-18T20:52:33.776150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"bdeed3e0-759c-47e4-aaff-1a717e7298de","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:ce36a3a97e9fa45882326b887012b9496604e16f4725133745338edc1a0eae8e","observation_id":"5769f3b9-e674-44aa-b035-0d3a24e4ed02","resolution":{"observed_at":"2026-05-18T20:52:33.779815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American mathematics competition - amc","venue":null,"work_id":"b06cd709-156e-40d3-a7a4-2673940b6f6a","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:0cb8ee3c699c05b1d273f335b072ea299bee08d514826562d9bfc15e3f66f2a3","observation_id":"4c78e818-9456-4aad-89d9-c237e427d7da","resolution":{"observed_at":"2026-05-18T20:52:33.783256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"dbd69265-77f8-4306-ae2d-ef48d1fb67b7","year":2021},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:75cb78aeba5dd5dce46e81dcdd59718b5e9a067a5047bc63f835983c0f32343f","observation_id":"ad0d9e4a-d37f-4c2d-8129-926b53fcc9fd","resolution":{"observed_at":"2026-05-18T20:52:33.789102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"b0734887-e0c8-4c0d-afa4-1dd35a63a036","year":2022},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:061a328b6c8efb955d41c0e7dc6b78a33f54be30c6d1cf84de059021d404b571","observation_id":"346425fb-271c-451b-b981-072f5b73c05a","resolution":{"observed_at":"2026-05-18T20:52:33.794425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:53:54.996504Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"9bab07dc-d876-46a6-9ca4-c0589d9a5004","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:649b7fe94159bd37b1c82866b3f65e4eb01779ba7da884f4b921d1e6021ab6b2","observation_id":"6f05626e-695f-4967-a5d4-1377e44d62e3","resolution":{"observed_at":"2026-05-18T20:52:33.800330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-17T04:59:59.434643Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:d56782bbb566b7fd1eaa6477e759a4df6dd81413fe3ae5e63e9ee4a9d09df308","observation_id":"5c417ec9-007a-476d-bba7-1922037368d0","resolution":{"observed_at":"2026-05-18T20:52:33.699361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.357487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":"79f56903-1765-4b3e-9439-6b613bd61844","year":2021},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:117b79fc95d62f86b8c84a7d6760e5d0d936d721891b4fa05242643e740338bc","observation_id":"91521688-f5ce-4ac0-ae3b-4e9de7211fc7","resolution":{"observed_at":"2026-05-18T20:52:33.804471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":"b9cf8a21-fad2-4458-ace0-af0417c3a43d","year":2022},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:d89e5afeb06c42b0b081e6e3cbd867a10348f9fe8790c51bd3840604aebcc39b","observation_id":"26835d4f-2536-4123-aad7-88ce73a16de3","resolution":{"observed_at":"2026-05-18T20:52:33.809575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":"c63609c9-a620-463f-87a3-ed81828c1dd7","year":2023},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:34cda5517a44461cd06b96bbaef7a192e98da0dae40da20b63ce77c4b9bb33fd","observation_id":"a9b6e0cf-c930-4050-ab40-b9e3d51a231f","resolution":{"observed_at":"2026-05-18T20:52:33.816463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"07b6c5cd-8fc6-4d4d-9a07-99d77dd56b47","year":2023},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:72a31c429c041664f4dbd0c69bdd9c5d43aa249f78e8d90f87ef8bf523d20804","observation_id":"2ffcc323-b873-41c4-9b99-42734d9af7e8","resolution":{"observed_at":"2026-05-18T20:52:33.820615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"4e1e92f0-98d7-42e8-8faf-401d2480dc00","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:e31b4ce3458507523739277a3e5d7c421b89c14018b25fa1cda0a97dcb921cce","observation_id":"164d5c1f-a245-4616-ac35-257d945aac9b","resolution":{"observed_at":"2026-05-18T20:52:33.824701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:53:55.007852Z","title":null,"venue":null,"work_id":"ffd1cc3b-59da-476e-8c0a-1daf5ae49e7f","year":2023},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:2accb2bc1cd3e8022b1f2845b2820b303fd7d33843ad17f464ca73c30e71d6f4","observation_id":"530d317b-ed23-4f40-bb8d-e586549599df","resolution":{"observed_at":"2026-05-18T20:52:33.829282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning","venue":null,"work_id":"47b3c500-8061-4c6e-97e4-6a9aad1d2b31","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:4139871cac04b5759f502d1bfc703c009b6c447944dd35655e22cbe160cc1aaa","observation_id":"10cc91c2-8100-410c-9168-3e433426bccf","resolution":{"observed_at":"2026-05-18T20:52:33.833898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":"a9d6be15-5658-4f9f-8733-d5990fb08d58","year":2023},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:975bb3c6ad4503d8689c1492b5415b74b1451aaec520b1a61baf0dc613bf5655","observation_id":"2c2a71e3-91f5-4af9-a98a-ac712c3c4df7","resolution":{"observed_at":"2026-05-18T20:52:33.840161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"9e4a2413-df9a-464b-9653-140cf58a2ecd","year":2023},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:4075b2ea4eda93f78c574830605730d1c66000208fcf42ef2a191a1e4ed58a67","observation_id":"c77aede0-9205-417f-a444-6bc3afe13e97","resolution":{"observed_at":"2026-05-18T20:52:33.844846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.253101Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"21f76b7e-6599-4e14-8bea-b56f9367f220","year":2020},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:49aa5318d9058ba084ffd2ea15ef32cbb604d3a16253a375115ef336dd35a456","observation_id":"8d17720d-5fb7-42db-9826-95e81a245a76","resolution":{"observed_at":"2026-05-18T20:52:33.848529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":"d819f60e-aaa2-4ac0-8100-d468ebee6d75","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:65a81a9af9755dafea80d3861f1c49f5482fe22100155ec02057b358a83865dd","observation_id":"0f67f247-b569-499c-a439-156277766e15","resolution":{"observed_at":"2026-05-18T20:52:33.852649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04265","last_updated":"2025-01-12T05:32:57Z","snapshot_observed_at":"2026-08-18T11:14:43.019131Z","submitted_at":"2024-10-05T18:55:01Z","title":"AI as Humanity's Salieri: Quantifying Linguistic Creativity of Language Models via Systematic Attribution of Machine Text against Web Text","version":2},"cited_work":{"arxiv_id":"2410.04265","doi":"10.48550/arxiv.2410.04265","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.04265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai as humanity’s salieri: Quantifying linguistic creativity of language models via systematic attribution of machine text against web text","venue":"arXiv (Cornell University)","work_id":"6e9b192d-a91f-4543-8f44-68964762a2f5","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2410.04265","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:25fc6aa636d79d6611deecfcf7e3ac60bd7622087dbf3db6a20eeb22306c5463","observation_id":"203275a8-477a-4007-8762-adad24320538","resolution":{"observed_at":"2026-05-18T20:52:33.719088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind 12 Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":"4480893c-e03a-479b-a7ae-2ad5b1827f8b","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:854da7981e4d915aa3b9270cf7d8a2a0aecc767874ff0bea0c0176daf26f3e48","observation_id":"76225005-8ccb-4468-b2d9-d0cf9f0ad41e","resolution":{"observed_at":"2026-05-18T20:52:33.858216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":"01199922-f827-4c67-9afd-e1ae76f475f8","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:378fa3ecc20917e3c2b8a357fa08f645bec1f625d335d06cba4402a511eb2a7e","observation_id":"aee5fc0f-31e1-4b00-b5e9-49dd4ef86a5d","resolution":{"observed_at":"2026-05-18T20:52:33.864157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2212cdc4-3cc0-4e10-8b5c-cd4460055c42","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:a366868dbcfadcf9bc7844b4d5d6f87dc0f1eab1a90474d7325ab69e4fdd68f8","observation_id":"45d5ab71-34b9-48c7-bf52-b7cd86a5e60d","resolution":{"observed_at":"2026-05-18T20:52:33.868519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7be712a0-2218-4a09-8a56-dc169543841f","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:50b9ac7f85b5c55e276d844ad6f8d6c6c89f22a7b0605e7585a8e6a3f0cd20ec","observation_id":"f63224ff-cf95-435d-b7b6-48b88c80fd25","resolution":{"observed_at":"2026-05-18T20:52:33.872232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mirror descent policy optimization","venue":null,"work_id":"c57f4e21-42d9-4efb-9e6a-266a58ac3911","year":2021},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:e689572b93531558c99d2d070dc19b56799db7b3fd93818951d7769bcebb6718","observation_id":"79d7094c-b39f-4277-a9de-180580feadcf","resolution":{"observed_at":"2026-05-18T20:52:33.876291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"65bd13f6-c36f-448c-86fb-2feb9f02e93d","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:8f2cd27aef350d4450147e1ebadb7572d27ca178e7e329bacb6fb2a595ef58dc","observation_id":"d466648d-2945-453f-b53e-4d6781f8629a","resolution":{"observed_at":"2026-05-18T20:52:33.880257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":"46670448-305b-4adb-a1ae-e746934f95f6","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:a4a84800290562d56cc79eaaacb232db719bb341e69273b484395a0065eccbb0","observation_id":"759eee3b-d102-43a2-b0bb-61c78a1f5e64","resolution":{"observed_at":"2026-05-18T20:52:33.884171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"05f55cd1-c1cc-472a-8f9d-e8a232eeff50","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:036f04a6db61739f0586427bed5e161f4b020b8a049a9f99a83ddf5f0ae3391d","observation_id":"2b8cff30-f1a7-4cab-a1c9-4b1857646c86","resolution":{"observed_at":"2026-05-18T20:52:33.887556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":"cc55ccd7-c0f0-4fbd-b859-e4463d56bef2","year":2013},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:621847e86d28b2c038c14fd9ae99279be311eae05cfd7cc1efbf5fef507e15c9","observation_id":"19d77b62-eb97-41df-913c-99317297aae1","resolution":{"observed_at":"2026-05-18T20:52:33.890735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"057bead0-fcea-4e14-8033-538229abf6c4","year":2015},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:516ff8a3a5f1bbe8eeabdb7acf4200e8831131818c15f9ea4c7dfc12031d41a5","observation_id":"1477d07b-b4a8-4f43-8183-ee41aac0f9c4","resolution":{"observed_at":"2026-05-18T20:52:33.894533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":"c5450117-2599-4661-abe6-0d1d8800e3da","year":2017},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:eef171f554ddd0723c2fb6aad4963dfddeab3b6946a4c838293d96c358174898","observation_id":"8bdf552e-43e1-41d6-b700-0c12848922cb","resolution":{"observed_at":"2026-05-18T20:52:33.898429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:840f126d9fbc98e63dd792e592e1cd072279707562a5aa4aaa2d95fc9ca5bda3","observation_id":"9b6e9b70-3ad0-4aa2-8d87-7e3fd4ddb4c5","resolution":{"observed_at":"2026-05-18T20:52:33.711723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities","venue":null,"work_id":"d11d0f29-6b85-477a-93ed-f32da03d777f","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:893ab1a4af24113d0b0968c1afae283541235af0fb8e54275822ea04338e4afa","observation_id":"50ec815a-887f-41b1-b2a4-faf5a47ed89e","resolution":{"observed_at":"2026-05-18T20:52:33.901749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"405e4e04-e7a0-49c4-99e3-9dd8d7ef7a6b","year":2022},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:e7c1ab3784dac97b7d0eb6481fd17c8a3a43483cefccfa600a32fa106d98129d","observation_id":"e4515ad7-1ba7-4bd8-acd5-42d3be0fa1b1","resolution":{"observed_at":"2026-05-18T20:52:33.905512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-08-18T15:25:16.958531Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":"2403.09629","doi":"10.48550/arxiv.2403.09629","metadata_source":"pith","pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","venue":"cs.CL","work_id":"cd82874a-9e9d-46cb-9716-a06d454a9c7e","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:9a17c0518eee72ff0b5f0d852b5bb8b6c406b636e9e16aa73428cd67431802fd","observation_id":"261f2417-ad85-4c6d-be4f-b9651063f3b6","resolution":{"observed_at":"2026-05-18T20:52:33.730999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":"2503.01307","doi":"10.48550/arxiv.2503.01307","metadata_source":"pith","pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","venue":"cs.CL","work_id":"f65a84bf-c5b4-4491-a618-18bb263c60e5","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:b26a1e0bfd47048f2a250441ee11fe2d07c981866088a123bc59bbe399ae377c","observation_id":"ddfc39ac-8803-4be4-9a5a-f6fb9d0158f9","resolution":{"observed_at":"2026-05-18T20:52:33.673649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scp-116k: A high-quality problem-solution dataset and a generalized pipeline for automated extraction in the higher education science domain","venue":null,"work_id":"4b886843-8b85-4463-9a35-a2d1925340e3","year":2025},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:df181af0e5b2c930cfe40bcf96d465b9b271bcdfac43f12a86bbfc803bae6d97","observation_id":"0e56cc4d-93a4-4104-9845-e4ea560b15bc","resolution":{"observed_at":"2026-05-18T20:52:33.909671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"0\": 1, \"1","venue":null,"work_id":"fac25668-efe1-4b45-8e4d-fedf4766c2ce","year":2024},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:06526fdc130b37169377e9456e360838edfe3f996527b342e0e56674e05dd0ea","observation_id":"3d9b0d6c-2395-4ac2-99f5-7f1d45d95b39","resolution":{"observed_at":"2026-05-18T20:52:33.913331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, the final answer shoule be a list of action plans for multiple steps","venue":null,"work_id":"1b35f300-1cf4-45d6-9bdb-91e2ad04b6a3","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:7108d1b8e5ed16547a8ffe8ac7820fd2d42e3703e054c5cf39f87d283ff579fb","observation_id":"34f53166-71e9-43bf-85f6-fdcae4bbe61e","resolution":{"observed_at":"2026-05-18T20:52:33.917445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agent[x, y]","venue":null,"work_id":"70a54c75-e965-4245-acfb-7eba0092c1c8","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:078be97cc93b06bff7cd32e96c3130d194d164afa3c0f0558de78dd74416d506","observation_id":"30701deb-379d-4ed2-a5dd-683c7f9bb4bb","resolution":{"observed_at":"2026-05-18T20:52:33.920950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ae861eca-84d3-4a0c-b304-9dc710cd053f","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:8635d240b5a2df367c676866f868b3b670ed8b89339d2fe80193434305831d37","observation_id":"56225a52-a014-4aff-ad30-f681612009aa","resolution":{"observed_at":"2026-05-18T20:52:33.924262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"81e59088-51a3-4879-a176-120188e51a89","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:589e0b7acde57da899df67bdff57a98d8d38160d18a3e36545b1dcd3c9812968","observation_id":"453d596d-c12c-4d87-9695-564725174cea","resolution":{"observed_at":"2026-05-18T20:52:33.928050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fcdb71d8-aefa-4bf3-bcf8-e6a906ef5e54","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:5ebe6052154949979f280c2530902e8675f7804ae3b22a617a2c450f99ce1eed","observation_id":"e5bd4e70-742b-4608-a5e1-f5b034d18afa","resolution":{"observed_at":"2026-05-18T20:52:33.931597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce33f4ee-5fea-467c-841e-15c74f56a0f7","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:026406dec2124d62b3b0bb07f35084de99786b771862397d676784d53c35bd17","observation_id":"739902a1-7692-4b82-a9a8-7948808a1042","resolution":{"observed_at":"2026-05-18T20:52:33.934957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agent[0.5, 0.5]","venue":null,"work_id":"2517fa77-aa21-4587-b823-8984612ff2be","year":null},"citing_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T20:52:33.620041Z"},"links":{"citing_paper":"/paper/2505.24864"},"observation_digest":"sha256:f4a276256143fb106c361babab770d9b94181245d3fe0a999c9abd120d7e2d97","observation_id":"c4baeffc-828d-43e0-b236-0b5f2df58d98","resolution":{"observed_at":"2026-05-18T20:52:33.938690Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":10,"verified_fuzzy":47},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 69 inbound Pith citation observations for arXiv:2505.24864."}