{"as_of":"2026-08-04T18:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ada5f92d20a381deea4c3d5290b0131dfa87cc792d6b5fa9b34352a40e2bf6e6","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:25:49.318391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-04T17:32:46.031253Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:be969dd4af3d24fe3d59de171489bb433fc8ed940b90938d1d54ceed8e424eff","observation_id":"890744d3-a472-471a-80ab-4a0d270be6ee","resolution":{"observed_at":"2026-05-22T19:32:01.153805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-03T23:08:06.327269Z","title":"S., Zaheer, M., Dhillon, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.327269Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:e76a6ac84baa0d814ea99415eefe1c2678f20a91b1d9193016930a2ccd327e7b","observation_id":"7132b63c-3286-4b58-8493-a9a9e8218e2f","resolution":{"observed_at":"2026-08-03T23:08:06.327269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2512.11470","last_updated":"2026-05-11T03:19:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-12T11:13:00Z","title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T22:43:01.937642Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2512.11470"},"observation_digest":"sha256:205b7725979233d27f3ba6226aa82d815ec9783e5b78d178b6a650fda18f21f2","observation_id":"332ccb78-ae5a-485b-a8ad-083a7a05303a","resolution":{"observed_at":"2026-05-16T22:43:37.855854Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2512.18552","last_updated":"2026-06-02T06:06:43Z","snapshot_observed_at":"2026-08-03T15:02:08.953642Z","submitted_at":"2025-12-21T00:49:40Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T16:07:48.570995Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2512.18552"},"observation_digest":"sha256:73ad6a86320cffd44b3ccc1cf5631e5dee2a5b8657b5e148171f3df047698b6e","observation_id":"e3886273-f2e8-45b3-9ed8-cf179c0f6d12","resolution":{"observed_at":"2026-05-21T16:10:20.191635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-03T15:02:11.739581Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal.The Art of Scaling Reinforcement Learning Compute for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18552","last_updated":"2026-06-02T06:06:43Z","snapshot_observed_at":"2026-08-03T15:02:08.953642Z","submitted_at":"2025-12-21T00:49:40Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T15:02:11.739581Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2512.18552"},"observation_digest":"sha256:8c294ff97978c21f38403b943e655098d11fc17bf657ead0809eaa2432366be0","observation_id":"8f6329e0-b46f-458e-b5d8-3be52158cd30","resolution":{"observed_at":"2026-08-03T15:02:11.739581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-04T06:25:49.318391Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-04T17:42:13.002895Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:49.318391Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:891432de57e379a54bd9bd10d2dca5382fa2606ae6a0364126b4f878e4172f6c","observation_id":"60fdfe69-e7a5-42ec-929f-df86bb10a6d7","resolution":{"observed_at":"2026-08-04T06:25:49.318391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2602.03839","last_updated":"2026-05-19T16:03:06Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T18:56:48Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T13:37:20.114152Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2602.03839"},"observation_digest":"sha256:b7649bbe6f56355d4428ed8f7d72ace1bbd399ad5b1bcd7c7169a230fc61b207","observation_id":"5ceacded-530a-40f6-a185-993217b6f506","resolution":{"observed_at":"2026-05-21T13:40:12.439577Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2602.04663","last_updated":"2026-05-19T01:58:21Z","snapshot_observed_at":"2026-08-01T16:15:18.708677Z","submitted_at":"2026-02-04T15:36:42Z","title":"Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T13:42:03.896311Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2602.04663"},"observation_digest":"sha256:8168f0818304cb51d18cb74bc2e85c5a1a3d7563402754465ab79431411bde47","observation_id":"d3b94f34-1b5e-429e-9d82-6df92ea03926","resolution":{"observed_at":"2026-05-21T13:44:11.524200Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-03T03:55:00.850928Z","title":"URL https: //arxiv.org/abs/2510.13786","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.06717","last_updated":"2026-05-25T07:56:54Z","snapshot_observed_at":"2026-08-03T03:54:58.967423Z","submitted_at":"2026-02-06T14:07:30Z","title":"F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:55:00.850928Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2602.06717"},"observation_digest":"sha256:b0e595719f84e4f5b2c1632034049026c013969d226a06eb121e3ba87c7a5989","observation_id":"98c45028-e813-4e69-853c-a91652bc950b","resolution":{"observed_at":"2026-08-03T03:55:00.850928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2602.14868","last_updated":"2026-05-08T13:05:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-16T16:01:27Z","title":"Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T21:38:56.393217Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2602.14868"},"observation_digest":"sha256:7d40309ad9f6cae5f41922976cc65761d166707944b10680323021dbf4395f67","observation_id":"a20f917b-130e-4f41-a5f5-0e635846e0e1","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2603.28507","last_updated":"2026-04-09T16:35:51Z","snapshot_observed_at":"2026-07-30T03:18:14.362050Z","submitted_at":"2026-03-30T14:42:53Z","title":"Continued AI Scaling Requires Repeated Efficiency Doublings","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:05.116491Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2603.28507"},"observation_digest":"sha256:8539511d97d76e2d47709b46a75399ac06944d9ab95b4bf90d298158811891d3","observation_id":"8591c9cf-73fa-4f71-aae3-0acc77639aa9","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2604.06159","last_updated":"2026-04-07T17:55:59Z","snapshot_observed_at":"2026-08-03T18:18:15.988189Z","submitted_at":"2026-04-07T17:55:59Z","title":"Target Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:21:37.744591Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2604.06159"},"observation_digest":"sha256:3afb0c51503b275deb620c5a833fefc1315c257242a3f9f0cc9161a240f3a24b","observation_id":"80bf37f4-c32e-4562-b049-4a83d4b7a9be","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:f7d915e9ba9a256c66081e676e386c8df883f4b0bd65814ab5ec7274cc4620be","observation_id":"4cd2668a-9b7d-46d4-98e4-0089d5428ba9","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2604.18381","last_updated":"2026-04-20T15:04:57Z","snapshot_observed_at":"2026-08-02T10:52:14.752020Z","submitted_at":"2026-04-20T15:04:57Z","title":"Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:55:18.468593Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2604.18381"},"observation_digest":"sha256:5f101a984c895c2e02d221ba6a9ea221eb575ed3abf710059e34649400775672","observation_id":"c957c6d0-7941-4db5-98ca-246120b096c0","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2604.20209","last_updated":"2026-04-22T05:50:23Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T05:50:23Z","title":"Scaling Self-Play with Self-Guidance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T01:31:06.090698Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2604.20209"},"observation_digest":"sha256:bf21dc2ab13f3c61dab69b464d4b867cfb58ce252d860d8518b36fe2a04bf88d","observation_id":"d659a415-43c3-4a8b-ab55-4ee4580f6cba","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2604.28020","last_updated":"2026-05-29T15:07:05Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T15:39:09Z","title":"Cost-Aware Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T05:11:01.131590Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2604.28020"},"observation_digest":"sha256:5b7a747c633aca0d3f9b486322e6033b7ab2270798c642ae61e72785910aacee","observation_id":"2e311385-4a51-4600-840a-99f31adea9d6","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:a400d53f47ae00f89241e034c1c1062afe2a43c82df44433fe26f75a1c23c8fb","observation_id":"9bc70a71-71d9-4439-9d9f-5b13c6f717c5","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:9552799c6e79575278e22cf1b21bf5d436acfc1c6112992d99e10ba889808990","observation_id":"5a63f6d2-3f06-4cc1-88fc-82de48b8aa5d","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:ff3addeda196ebc50067c7c5fedb5b061b8be77aafbfaa74416bf9ded1f63615","observation_id":"283135aa-3c85-418a-9a72-0b50b15b7fae","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-08T09:35:47.501360Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:127e6f4ebac45ce377c10d9f85b95b049844dcd3b64db629ec629763565f8896","observation_id":"da05758b-252e-4c53-a5a5-1d4486cbbafc","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T03:16:59.195706Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:b1d7962687d3cd275eb36c9b8039069c393bceef6853d14b34b7622a35051210","observation_id":"e4ae07ba-b1e9-4406-b13c-ed8be5e58f04","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-20T22:36:13.781114Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:de786da1907dc8616e9f07b8fc839cdf761a529d4cc18fb8b7d43da86d18f3e9","observation_id":"bd73d658-bfb2-4e24-a3b5-dfeae5a15333","resolution":{"observed_at":"2026-05-20T22:39:10.411305Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.06761","last_updated":"2026-05-07T17:17:10Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:17:10Z","title":"Weblica: Scalable and Reproducible Training Environments for Visual Web Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:44.578007Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.06761"},"observation_digest":"sha256:6a9260a4ef92d919131ba64fb10dce11e8952276574123e20ca0208a96ad4a78","observation_id":"8cf8928e-2eaa-4253-bed9-5eb90f8e9d28","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:07.462474Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.07865"},"observation_digest":"sha256:25868896d29ada5cb212c1a388ad2c2b68f249eca11cf49a2c3f78db21bf983f","observation_id":"f4d0cb26-0180-4e15-be8c-a0b6b6dbee06","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:53774db5e697d3ac9e1b0a67d29af58ded0cabbe21aa033670005f3f3eed2ba8","observation_id":"9e8e7edf-f295-47ff-9b1f-1ba7ae188728","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.10194","last_updated":"2026-05-11T08:45:03Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:45:03Z","title":"TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:56:09.363823Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.10194"},"observation_digest":"sha256:8c5443317b7fc8d6cbc8d76c03edcbafc1b0d703d95e989f3bdc4537a93d988c","observation_id":"cccee1d1-89b2-44d5-b2cd-786401296878","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.11739","last_updated":"2026-05-21T08:50:47Z","snapshot_observed_at":"2026-08-02T09:40:14.018328Z","submitted_at":"2026-05-12T08:19:15Z","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-13T07:01:46.325498Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.11739"},"observation_digest":"sha256:51045b7168be4c4cedd8a83ebff903162e109b1b80e26811153edd7936537b3c","observation_id":"2ad4c347-8285-43e9-945c-61ee19bac263","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.11739","last_updated":"2026-05-21T08:50:47Z","snapshot_observed_at":"2026-08-02T09:40:14.018328Z","submitted_at":"2026-05-12T08:19:15Z","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-14T21:07:43.168136Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.11739"},"observation_digest":"sha256:01634b51047383925708ba7e905b78e4446a067f2c6baf825723c45b6965aaf5","observation_id":"48bbc7fc-73a8-4fbd-a577-d5bd6be6699a","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.12484","last_updated":"2026-05-14T17:49:32Z","snapshot_observed_at":"2026-08-02T06:23:20.104772Z","submitted_at":"2026-05-12T17:58:20Z","title":"Learning, Fast and Slow: Towards LLMs That Adapt Continually","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:00:31.452781Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.12484"},"observation_digest":"sha256:21762b500afeb5962fc1036de96b99de4f601e22bada0c888288e967618f3294","observation_id":"336770af-d9bc-4cc6-9709-f44452ac097b","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.12484","last_updated":"2026-05-14T17:49:32Z","snapshot_observed_at":"2026-08-02T06:23:20.104772Z","submitted_at":"2026-05-12T17:58:20Z","title":"Learning, Fast and Slow: Towards LLMs That Adapt Continually","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T05:19:05.368681Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.12484"},"observation_digest":"sha256:2524115801736dc4ae6470534013db1910730cd9e7a6da743f4eda39bee1efe8","observation_id":"8ce70be2-cb62-4b06-ae07-e233b13cdf09","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.15871","last_updated":"2026-05-15T11:40:41Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T11:40:41Z","title":"Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T18:58:11.197587Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.15871"},"observation_digest":"sha256:c17e108655614874d20c07029f7aebd297412be40910b169bff73575dcbce7c1","observation_id":"e0d6d125-b30f-4223-8bd9-f922b29aa54d","resolution":{"observed_at":"2026-05-20T18:58:53.857181Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.02218","last_updated":"2026-06-01T13:20:00Z","snapshot_observed_at":"2026-08-02T07:13:54.412249Z","submitted_at":"2026-06-01T13:20:00Z","title":"Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:55.535914Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.02218"},"observation_digest":"sha256:63022b1199a2c73cd24f2f24ab96a5329d6a69a67398019b561cf3f0ce90cb35","observation_id":"e7e3fe6c-d9f9-44af-8dfd-0893782dd9f5","resolution":{"observed_at":"2026-07-01T22:06:17.099267Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-07-06T23:44:23.633099Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:8f320a582495b32d8acdd9096558450478d78252ba5eab3150e97334be9a35a3","observation_id":"d40eddb5-23b1-42d0-9853-690827aeed2a","resolution":{"observed_at":"2026-07-02T02:46:28.994858Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:00cb08a6fe09ad1b68b2724a0dc61e9417ad9cf48af5611b4739b8a40790d6d8","observation_id":"fbc048f1-6ec6-4991-813c-a93f9d112039","resolution":{"observed_at":"2026-07-03T09:47:59.843785Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:0bce5d1f09b45a8fd03068475b353dfdde8d930e2ac6e938c0863cf84dbbbffa","observation_id":"3b985535-95dd-49a0-a977-75a043a7f9a9","resolution":{"observed_at":"2026-07-03T20:48:56.161137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.18284","last_updated":"2026-06-10T02:04:29Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-10T02:04:29Z","title":"Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-06-27T10:36:09.211639Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.18284"},"observation_digest":"sha256:ed0be67952f402e377ede61f064a80881c772ef2a49ce7e9e994a7d807425a0f","observation_id":"90fe2acd-3c6f-4d6f-a600-5727a08e177a","resolution":{"observed_at":"2026-07-03T08:57:48.095122Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:a9a4a75bf6c47ec370ed7731b8e9a757460a09d72680494fb10926d5ae4e4fea","observation_id":"1513e3a3-426d-4284-a48d-ea0393642148","resolution":{"observed_at":"2026-07-04T18:40:03.282572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":183,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:62719761019ae5d332cb278c7ecac8267315d633598b96a57fb832153413c898","observation_id":"ea59d1be-41d0-4456-b515-19d2e8cd1779","resolution":{"observed_at":"2026-07-01T18:15:58.953101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2607.01490","last_updated":"2026-07-01T21:39:19Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T21:39:19Z","title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-03T20:59:57.539909Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.01490"},"observation_digest":"sha256:5783b93fc92b57b633e9f6ef4f788782ffc4e98a2c8ac85e68969d3a5f8893b9","observation_id":"16474127-7b58-4d61-a363-5702f9e930e4","resolution":{"observed_at":"2026-07-03T21:08:57.677335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-07-11T07:57:39.948830Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:63a90ef420a4ecbdb90e0de47f33e79182a1c91e5f078bb13c0927e65955df38","observation_id":"b886bcb1-417d-4c26-8913-2c0937be3a9f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-13T03:29:34.486347Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09375","last_updated":"2026-07-10T12:57:08Z","snapshot_observed_at":"2026-07-15T23:18:12.873790Z","submitted_at":"2026-07-10T12:57:08Z","title":"Mach-Mind-4-Flash Technical Report","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T03:29:34.486347Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.09375"},"observation_digest":"sha256:6d58bcc3c8798007ef2739d1d9acff53016701a74bb64d2176239b6b7b37cbd7","observation_id":"af318e1f-883f-4e64-93af-cb0701df1549","resolution":{"observed_at":"2026-07-13T03:29:34.486347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-02T05:22:33.420002Z","title":"Khatri, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13389","last_updated":"2026-07-15T02:34:35Z","snapshot_observed_at":"2026-08-02T05:22:32.106453Z","submitted_at":"2026-07-15T02:34:35Z","title":"Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:22:33.420002Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.13389"},"observation_digest":"sha256:39cba0140c1dc77010b9c1572a63105147f9ad9e8649ddac5acc49a9e79f1e84","observation_id":"5290bcba-6c1a-4b26-8172-e73dffe05623","resolution":{"observed_at":"2026-08-02T05:22:33.420002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-01T21:26:32.726200Z","title":"arXiv preprint arXiv:2510.13786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.726200Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:cb2169e1045826e7f45adb803efb7c707c53d8d5f20bd38a417d58f237515cdb","observation_id":"b84ad023-1d0f-4acb-8a1b-f1c422cb1437","resolution":{"observed_at":"2026-08-01T21:26:32.726200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-01T09:52:05.363334Z","title":"arXiv preprint arXiv:2510.13786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-03T07:55:46.072913Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:05.363334Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:848b84a397eb135a8210ea93ac2909977f4f3508d3816c58f15db47813246e87","observation_id":"6e72b1c8-2290-4794-a5a2-a98a76ad0bd4","resolution":{"observed_at":"2026-08-01T09:52:05.363334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.13786/citation-record","integrity":"/paper/2510.13786/integrity","json":"/paper/2510.13786/citation-record.json","paper":"/paper/2510.13786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d27693b0-c6ab-488a-958d-31df012bbe1e","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:870449644f11e404b6a05a5ff7de5e22cc7095a72aca1d34f8aeba108b6bf6eb","observation_id":"ae038977-eb78-49da-8e44-bfeb7f50ad5d","resolution":{"observed_at":"2026-05-16T16:29:14.085252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02387","doi":"10.48550/arxiv.2510.02387","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Cwm: An open-weights llm for research on code generation with world models","venue":null,"work_id":"7a74903a-6383-48ce-97b8-17afa5faeae1","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:b271ddd77c82208aea274b9795711c5dcbfa8acb5367268be544ae3e2c01bd48","observation_id":"28668106-2e17-437f-9bed-27f75d82d55f","resolution":{"observed_at":"2026-05-16T16:29:13.976324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-07-10T21:57:38.198014Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:5910974ac8c8b9c8a3755a4a7b429d571f7d72d622b160dc1b3278d7b07bbbb4","observation_id":"3134f12a-286c-4f99-add0-6531030943b1","resolution":{"observed_at":"2026-05-16T16:29:13.979906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2507.01006","doi":"10.48550/arxiv.2507.01006","metadata_source":"pith","pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","venue":"cs.CV","work_id":"366607ba-e4ea-4726-98c3-63356e32351c","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3394eba208f61a08cdbac55fa198eebec903b3f5d30fda4d14b0d1de24ac1762","observation_id":"bd699a5d-3ef4-4bbd-9808-05ad9436106a","resolution":{"observed_at":"2026-05-16T16:29:13.983934Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:39436405c23e55ab06beb847702b090a150c0f4a32ed1f7568ef219ce3a2598c","observation_id":"99ddcc83-aa44-45f4-8bdc-3c5d3c0a65e1","resolution":{"observed_at":"2026-05-16T16:29:13.972253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:97f5c7eb2b11c3b8365d109320f450f5853130765d05e187bc091136fe4a0334","observation_id":"4f6f3687-96ac-4848-bbd8-7f190b9b76ab","resolution":{"observed_at":"2026-05-16T16:29:13.987105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:d0680fec0ba7d9fc7bed3ca64f7183696a41aa08f63893c47a6ab37253b2f284","observation_id":"6eaf8934-e196-45dd-91e2-c8af25ef7b38","resolution":{"observed_at":"2026-05-16T16:29:13.990510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:461867ebe8968d5fb39281608ba19d556db545a44ebb278934c87d3e1ae41f7d","observation_id":"a999b556-f4d4-42ed-b4f6-329a44108c6c","resolution":{"observed_at":"2026-05-16T16:29:13.993355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:7d3b65608b2e1bc8a435d84c8e2e18a2a11894286643c435d41787d05e63b064","observation_id":"8bf06b28-cf5e-4ad1-b1c1-798304e1d709","resolution":{"observed_at":"2026-05-16T16:29:13.996692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:c4dbc9081c0a85723a6975271e4f7d5f47303c2985e5eb03f7c11f62485e5241","observation_id":"150fcd04-9d9e-427d-9dba-c88f8f72ac38","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-07-10T15:07:19.639582Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:6bdea95d28cc11e550a1802900895fafbd2f4ec97f8c5d942a4e5416cb1ff60d","observation_id":"38ae454e-4f7b-403d-a66c-cc2cee262063","resolution":{"observed_at":"2026-05-16T16:29:14.003804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:a0f3d8610addba82c6865d591c63042e5dee86e1c7c7ccbb46e99df0a9515cb3","observation_id":"16e52cfc-216f-4d74-b354-52098de5ed16","resolution":{"observed_at":"2026-05-16T16:29:14.006669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":"2305.16264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-07-04T21:10:09.117208Z","title":"Scaling Data-Constrained Language Models","venue":"cs.CL","work_id":"e79ca454-d3a2-4c0f-8010-9d81c75bf2d8","year":2023},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:547ad32d8478130c85780a639a286ce43ef165d959cadbde39a05f90bc386ce0","observation_id":"7b26de1a-636b-4273-b24e-264f667f04ff","resolution":{"observed_at":"2026-05-18T01:35:21.865142Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:141987a2e7047bbba9f606290cc1a29349242c5097634886b7ad57f3c8bfbc93","observation_id":"dce19e5b-ab95-4c40-b085-3e52dadf25c3","resolution":{"observed_at":"2026-05-16T16:29:14.013407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-07-06T17:13:25.341853Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:5cd1567516d484e86e83f678e1cea26d186f05da7ed890f3e44e7f477f8855f6","observation_id":"75ebfafe-8d71-4a7a-90c1-c041c162b77d","resolution":{"observed_at":"2026-05-16T16:29:14.017077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-07-06T18:37:55.945869Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":"2406.19146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-06-30T08:24:26.777027Z","title":"Resolving discrepancies in compute-optimal scaling of language models","venue":null,"work_id":"651c4663-eeef-4500-9585-de00f9300854","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3f73bd7ac528126604d1a43d4ec0597d8bda0de3829a42d30faa9ae233fffbee","observation_id":"33c67b5a-9d66-4a3c-abb8-35214a292016","resolution":{"observed_at":"2026-05-16T16:29:14.020476Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":"2405.10938","doi":"10.48550/arxiv.2405.10938","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Observational scaling laws and the predictability of language model performance.arXiv preprint arXiv:2405.10938","venue":null,"work_id":"e584b9ea-2c55-4358-b53d-c8f3a6b3422d","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:73e92f15e61ccfeabca2cca9009b6eb2421510207d8585fbfb45e60f49fb977b","observation_id":"b9720cbe-1dcf-4070-8683-8df9cd1a62cd","resolution":{"observed_at":"2026-05-16T16:29:14.024807Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:e5f6aa0c516b11f6e78bb1f7d3c8b2d9994c0df2d98e4b31e163091169f901fa","observation_id":"1591812d-8566-4314-bc4e-a05bd89db3d4","resolution":{"observed_at":"2026-05-16T16:29:14.028011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2410.08146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-07-04T13:59:51.893694Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","venue":"cs.LG","work_id":"441f2f86-f865-4551-88a5-52267f220c59","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3bc182296049eb4043598edc5eedb246e93b3407bfd643eab2abd2d55fb9e971","observation_id":"9356063b-adf3-4de8-9c53-d56af148e932","resolution":{"observed_at":"2026-05-21T01:42:19.263401Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3849c2dea74132568e61566229fd86a969e3f22b08521d65f4924788866e61d9","observation_id":"a3e4bc57-bbd7-42e9-a1b9-7b1ca3204f87","resolution":{"observed_at":"2026-05-16T16:29:14.034600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":"2405.00451","doi":"10.48550/arxiv.2405.00451","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"P., Kawaguchi, K., and Shieh, M","venue":null,"work_id":"c32202fe-3b76-413d-8db1-885ff3480fe6","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:25ae77db6c5c3c8d82d9e48360da968768a343948c521a115f89cb8273a4ddcd","observation_id":"0f043711-7720-401a-a758-a72b39b21b18","resolution":{"observed_at":"2026-05-16T16:29:14.038199Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:848ac63da6addaa9e431487c96e0176c9cc6f57b1fb1ac2d3b7c142b95e8f6d7","observation_id":"9590be79-55de-442f-a855-e92239a3bc6d","resolution":{"observed_at":"2026-05-16T16:29:14.042708Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3753d704770673df99895f909492f520c4a440930aadb238bb9004953f7271df","observation_id":"2498844c-269a-4133-ac73-4c622c4676f8","resolution":{"observed_at":"2026-05-16T16:29:14.046510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-07-06T20:45:41.540398Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:9166f3897d47bb104c5744b9a7d5f7b5dbbdae14cc912b14eeb42c23dc00ae47","observation_id":"ac9027f1-458d-4505-a4d9-19450ba8c1d2","resolution":{"observed_at":"2026-05-16T16:29:14.050525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:cff0ed50720772344ac69fcf1e8fbb8d9d393806609ffe6ad1bce7fe5ccc681b","observation_id":"2216c8df-3317-471e-98f8-c4ba2496518a","resolution":{"observed_at":"2026-05-16T16:29:14.058755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":"2408.15240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-07-08T21:25:38.629808Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","venue":"cs.LG","work_id":"dbe9c116-8030-4e7c-a259-b52c80846d0e","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:ece5e6cff088232885fffdb6a6afe1165034b3cb8305b3ed2cff2ad47e7559db","observation_id":"b6ce8d30-d08c-425b-bdea-ea3187e8cd7e","resolution":{"observed_at":"2026-05-16T16:29:14.055173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14727e46-873f-4dbf-8b65-52ff87af9c11","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:adb0e69b07d322ebf1910596474580a7f9e339f79039ae86d3672b0884578dd3","observation_id":"0eb73f6f-96c1-401d-bf78-f5b1608761cf","resolution":{"observed_at":"2026-05-16T16:29:14.063973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2017) for LLM fine-tuning with verifiable rewards","venue":null,"work_id":"75e3294a-9edf-4b0b-aa6a-f9e2878d8075","year":2017},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:bd4a3cdedf47a471a86d2246d0d9f6449f6c0325acb1f2120a1565b2a3a07882","observation_id":"0cb31d43-77b5-44dc-aea0-286e1738bf4d","resolution":{"observed_at":"2026-05-16T16:29:14.066378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4205ee17-bfe0-4269-a35a-c6283e6eaa20","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:c3c284da16cc483ac3478ae2966fc892f4ba2cc31ca18cddf5097b2a04059f5f","observation_id":"f435c24c-0f8c-484b-a314-662c4c3ba130","resolution":{"observed_at":"2026-05-16T16:29:14.068606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The lowerϵ is to avoid gradient clipping (epsilon underflow) (Wortsman et al., 2023)","venue":null,"work_id":"3afc1296-110c-4377-bcc1-d12c3a342e0f","year":2023},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:2952c69673ad0eaa25583de6d32fdfb8f4d441b3fed81bf919d1e420947b371f","observation_id":"b75671b6-7cc2-4069-87b3-ae90f9f15f8c","resolution":{"observed_at":"2026-05-16T16:29:14.071043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We use a custom code execution environment for coding problems involving unit tests and desired outputs","venue":null,"work_id":"7fb85160-3dcb-4f25-b89d-a349e589e073","year":2020},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:fda0923bee2dfa5e68dad9bd2a08cdcb5b073a0572c46e3d1680d9277b6a1a88","observation_id":"e3afc2a3-101b-4fad-ace2-16d0932efb15","resolution":{"observed_at":"2026-05-16T16:29:14.073989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We consider two approaches: (a)interruptions, used in works like GLM-4.1V (GLM-V Team et al., 2025), and Qwen3 (Yang et al","venue":null,"work_id":"3fe0a0a7-c4bc-4061-a785-e44cd588279d","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:ff852a80533ee2a14c6dd14805ff5a2b6bac234da76c37011661579e0ce60c1c","observation_id":"9677fa14-0eda-4d7d-88f6-1027e68e1c17","resolution":{"observed_at":"2026-05-16T16:29:14.076619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Okay, time is up. Let me stop thinking and formulate a final answer</think>","venue":null,"work_id":"348f0752-2e85-44a2-bb1f-648d1cbfd64c","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:a233bda587bef3b453bdcf263edbc9ca23d323b0e5e0256d640b7ab9b5d8377d","observation_id":"c173bf54-65e5-4a42-909e-fce8989db88f","resolution":{"observed_at":"2026-05-16T16:29:14.078959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a9d0d7b-aaf6-4e1d-8052-101f0e226900","year":2048},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:c2b7c7a3355fcb16de523c2b706f19705a8124225291dfb267b8a54e4d0cee05","observation_id":"96997020-d3c7-48e3-ba2e-29fe91c5f2a9","resolution":{"observed_at":"2026-05-16T16:29:14.081042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"343118c4-a324-485c-b904-af9c092dba97","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:2e9fd12fe15790cb235e3bfa819e70e49ed07f43dc8d6cbb4b56f53e4027a233","observation_id":"1632bf95-b2b1-4e9d-adbb-c9724059a112","resolution":{"observed_at":"2026-05-16T16:29:14.083158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specifically DAPO drops 0-variance prompts and samples more prompts until the batch is full","venue":null,"work_id":"d13ec25c-6f8c-4345-b34c-ad4180ab8e16","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:3aef693a8945a4c15456861da3e0760286c376cddf22af6b64d525919b98e9e1","observation_id":"bbf1ffff-e25f-4d55-acec-73cf9da2baac","resolution":{"observed_at":"2026-05-16T16:29:14.061537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":5,"verified_exact":12,"verified_fuzzy":6},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 44 inbound Pith citation observations for arXiv:2510.13786."}