{"as_of":"2026-08-06T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dad197073170c1bd2eb55e58ba1a43028c3d5fc00f6d205404e815d034f5352","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":123,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":123,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":73,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:17:54.142833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:5c717dcd1983df277405e543f8201a38754f17fa534b4249ce9d4a26540055ed","observation_id":"82ad9e0a-fd61-4bad-ad06-681f30b30f8b","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-06T17:30:19.713756Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:1a816bd30fd35b6bdb8a45e09606cf15a128cdda2c2b380cab942de8a69c82ae","observation_id":"87c5e038-0a6d-4e4b-b4a3-bd42cce82f05","resolution":{"observed_at":"2026-05-22T19:32:01.288940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T04:17:54.142833Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.142833Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:b4ce3071fa34c8f45881cd0f742e36b4eccba0a64ceaedeaa84cd88890b0426d","observation_id":"c27dc36d-5ebe-46fa-ab14-4e34213b8488","resolution":{"observed_at":"2026-08-06T04:17:54.142833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T15:10:17.779979Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20404","last_updated":"2025-09-01T03:56:31Z","snapshot_observed_at":"2026-08-06T16:43:03.152770Z","submitted_at":"2025-08-28T04:04:30Z","title":"AWorld: Orchestrating the Training Recipe for Agentic AI","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:17.779979Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.20404"},"observation_digest":"sha256:4194e4241626d6519b0d53f5f09f9ec1b6445d645469cde6582a70a10663169c","observation_id":"0525c134-88c7-4d1a-a5e2-4c201a03f947","resolution":{"observed_at":"2026-08-05T15:10:17.779979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:2d73b2deba02b44e4c3c3ce58d218513531ad59d1cfd5aeeea3a50b954ee21e5","observation_id":"8011cfc6-c1fd-46e9-a2f6-a47513364950","resolution":{"observed_at":"2026-05-18T00:02:25.401254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T16:07:29.199481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.199481Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:744d9e828b12109bc7fec74ee08b7beef775360b5e8bd29df333e4fe144303aa","observation_id":"d8d6583d-a411-4896-ac62-6ef44ab2e356","resolution":{"observed_at":"2026-08-04T16:07:29.199481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T10:50:09.254400Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08525","last_updated":"2026-05-27T17:54:39Z","snapshot_observed_at":"2026-08-04T10:50:07.221513Z","submitted_at":"2025-10-09T17:50:00Z","title":"Which Heads Matter for Reasoning? RL-Guided KV Cache Compression","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:50:09.254400Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.08525"},"observation_digest":"sha256:81aad742c0ecffb7246f5ed94f2be21d9abeefb4cbf83f11c51b7d5af16b7144","observation_id":"413d2afd-76e0-4a29-bcf6-2e2cd3ca6ef8","resolution":{"observed_at":"2026-08-04T10:50:09.254400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T10:39:26.538300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-04T10:39:20.309514Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:26.538300Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:1e775e79ccf4f9d1c1280eb67861e1e5734252173ca3218e9bca969da8d9e072","observation_id":"8f02a984-a9be-4d4e-a564-8ec48c2572e0","resolution":{"observed_at":"2026-08-04T10:39:26.538300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:17e2f68fedf1f2d29f3ef0175a790a6d82126814399731620db6f0ebb35bb7bd","observation_id":"dfc8bfee-2973-4ef5-ac6b-aeaf4c5df871","resolution":{"observed_at":"2026-05-18T05:30:55.176765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:af5d82666f5ca53a4432961b3db6d500aa07c8b1afdc2fac4103f74f38b2b837","observation_id":"4bee1411-9875-4874-9e6f-8841b42ac7a5","resolution":{"observed_at":"2026-05-17T20:40:14.640754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T22:21:26.271796Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2512.12476"},"observation_digest":"sha256:abb04677bf5c02a9fba5c9943675641fcec146f9c920e56293ce05772f930645","observation_id":"aacc2d48-dda8-4a96-a6ab-3f900befb151","resolution":{"observed_at":"2026-05-16T22:23:36.646232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T11:08:09.185820Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07376","last_updated":"2026-07-06T09:21:40Z","snapshot_observed_at":"2026-08-05T07:22:32.174869Z","submitted_at":"2026-01-12T09:57:46Z","title":"OpenTinker: Separating Concerns in Agentic Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:09.185820Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.07376"},"observation_digest":"sha256:cd12060fe8cfeed91daebba95eba65ae81917de66f5094066eda13595f909838","observation_id":"70d7ed3e-a225-46ab-9638-255e8247c743","resolution":{"observed_at":"2026-08-03T11:08:09.185820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T06:25:47.347729Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-06T17:36:58.612424Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.347729Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:43dde6e5d0ed02d71049fbf131328bbad674f9924496d29a01ac95b3b1647c9b","observation_id":"7d2d5ef5-381b-41af-b18b-44f0ae5fc23f","resolution":{"observed_at":"2026-08-04T06:25:47.347729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T09:01:48.820681Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.820681Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:c858b2e403333bd4b18a9a7a05f68523ae090bf7a83d44f751d4fbbea3ffd655","observation_id":"bbaf49e3-f50a-4ba9-8bc2-a838fd1b49c6","resolution":{"observed_at":"2026-08-03T09:01:48.820681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-02T16:35:13.446446Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T11:07:18.839899Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.18150"},"observation_digest":"sha256:435f59681d9575195504060c1ac1974c73c4840b3b857027ea26c0779d24d0c2","observation_id":"26e97cb3-bbe2-4ffc-aa2d-49d925b892c4","resolution":{"observed_at":"2026-05-16T11:07:47.092261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T07:01:12.356383Z","title":"Kanishk Gandhi, Ayush Chakravarthy, Anikait Singh, Nathan Lile, and Noah D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21476","last_updated":"2026-07-08T14:57:44Z","snapshot_observed_at":"2026-08-03T07:00:59.493754Z","submitted_at":"2026-01-29T09:56:15Z","title":"Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T07:01:12.356383Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21476"},"observation_digest":"sha256:73616575cfa77a0d7243c8bb4b15b22c5aaaced1e9fa86deba64696916de7b7e","observation_id":"eee55e6b-5056-48fa-a879-7ed6a6f470ef","resolution":{"observed_at":"2026-08-03T07:01:12.356383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-03T13:18:34.276013Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:37:57.120779Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:f2220e34eb835710ef891a35fe05eb85b77028221b4fb5d3ac909045db4c935b","observation_id":"7c0d5b6e-5517-449d-bb89-e4a7f943ed09","resolution":{"observed_at":"2026-05-16T09:40:49.102585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-03T13:18:34.276013Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:2e222e126de88ff4124f489de0fb5a274a708370a09c5fb0bf70de1dc2bfbe7d","observation_id":"4c092ba1-561c-46a3-a115-ae396192aaa4","resolution":{"observed_at":"2026-05-21T14:10:13.456057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T05:32:40.837833Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02192","last_updated":"2026-05-26T02:43:34Z","snapshot_observed_at":"2026-08-03T05:32:39.033836Z","submitted_at":"2026-02-02T14:57:53Z","title":"ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:32:40.837833Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.02192"},"observation_digest":"sha256:15af94256811d60eb7875ad3e3960eb6f4b56d1d97f376342103705b4eacd5e4","observation_id":"af19c22a-1aa9-4c5b-87fb-42df5799b123","resolution":{"observed_at":"2026-08-03T05:32:40.837833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:01:54.696390Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.05765"},"observation_digest":"sha256:d53c7c2a714c0803242dc968b867d5902ec7bfcaea9184dd8e47641575605c87","observation_id":"084fafff-b067-49f9-a8bc-5ba0b9385e35","resolution":{"observed_at":"2026-05-16T07:02:28.930758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2602.06932","last_updated":"2026-05-02T06:02:57Z","snapshot_observed_at":"2026-08-06T14:10:22.450479Z","submitted_at":"2026-02-06T18:28:54Z","title":"When RL Meets Adaptive Speculative Training: A Unified Training-Serving System","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T06:33:41.860803Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.06932"},"observation_digest":"sha256:d244ce0b7f39c62a9d6636169fad9aa7846aa259f46ed08e253a9366ecc8edb5","observation_id":"996aeed6-6acc-4490-8760-039426f88fec","resolution":{"observed_at":"2026-05-16T06:37:28.921689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T23:32:11.710514Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-02T23:32:10.162628Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:11.710514Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:4dd77f1850f27be209c13bb0e534e5b16810967d4d0f930522470f5defbe7c85","observation_id":"082f7f1c-3122-49c3-9626-0c5d3de20b55","resolution":{"observed_at":"2026-08-02T23:32:11.710514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2603.05295","last_updated":"2026-04-14T08:41:56Z","snapshot_observed_at":"2026-07-30T11:26:33.784873Z","submitted_at":"2026-03-05T15:37:34Z","title":"WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T16:33:58.746944Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.05295"},"observation_digest":"sha256:0aaaaf0050f3607b73c1167be9b078a0533e5357650958022f8757c530b89b2f","observation_id":"0167d83b-c497-4164-8fce-0954ae9341c9","resolution":{"observed_at":"2026-05-15T16:36:17.548558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T18:45:20.779259Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T10:24:18.271018Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.779259Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:f6b1a31da7e36f89f53302a1396b417d8f27ec475a6d691c3260536e527dca7c","observation_id":"c0f8730c-77fb-48c0-ac05-e358dc8b2efb","resolution":{"observed_at":"2026-08-02T18:45:20.779259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2603.10165","last_updated":"2026-05-11T10:03:41Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:59:01Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:56:30.316823Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.10165"},"observation_digest":"sha256:0482ae03da87153d9bfa9dcf16afc32e2a900891dcbab7a0d1ecb02503471b95","observation_id":"9e196520-b2b4-49e4-9d2b-1e01e7157541","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.09107","last_updated":"2026-04-10T08:40:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T08:40:56Z","title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:33.020610Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.09107"},"observation_digest":"sha256:8a1fe0bbabcfbe6cd18fdd5e34bd063c8060aa1ba2b519f442470f45e533f92d","observation_id":"9799de75-3d03-40f4-8300-dda427b53027","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:34d53465e898a69b128a21aad04b247a2a0ee8c248b1da0f8af32bf82b4a2c29","observation_id":"a80d0625-6c83-4771-ae17-5c4bf08115af","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.16918","last_updated":"2026-04-18T08:51:29Z","snapshot_observed_at":"2026-08-03T04:30:53.769713Z","submitted_at":"2026-04-18T08:51:29Z","title":"Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:27:15.270996Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.16918"},"observation_digest":"sha256:b06b1e6d08641d5670b9457f82563356788f2ac3328e69e5c8a17c6911a5c712","observation_id":"ec567ed1-d217-4fe4-b075-28002f1fae0f","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-06-21T13:04:23Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:22:39Z","title":"StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T04:26:59.781416Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:3b00174e1eed9fc35c3c8a32924b0845e90c216ed6baa7d700d41afe8b3cee59","observation_id":"15ec06f5-f9ea-4654-b1b6-b027fb62a2e5","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:f810cd311b5564ea43d34ea69656b0698136f87dfb46198e41d24776187ea570","observation_id":"28d5ebe2-0bb1-4463-abb6-4feedf122d17","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.26103","last_updated":"2026-04-30T09:10:31Z","snapshot_observed_at":"2026-08-04T04:01:51.865779Z","submitted_at":"2026-04-28T20:36:50Z","title":"AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T14:16:46.241126Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.26103"},"observation_digest":"sha256:1ebd81a3319d94c7e30c891e47d70725e85f2af67c948d0e993416bf6cbf41d7","observation_id":"3348572b-979b-420c-814a-95fb44087120","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T13:49:26.560459Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.26256"},"observation_digest":"sha256:347d47ac72b9a98487945d203e53ff6baabf9aab5dee9d03f1d3f8cb1f14d5de","observation_id":"8795d9fb-7462-4608-9133-2903e6a01b50","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:27c26eecbdb1020b2bd2911e12a20787376d2e26991d04abef6d585ac6a48c79","observation_id":"6de70064-9924-4c14-83f4-7eebe1b6b2aa","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-02T07:53:28.208356Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:60aa3342820f61ebca070d1245ea7124b581947763ca497b6980477bf832439c","observation_id":"bb3aa539-f7b4-4b52-b501-bf34ab776043","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:9bb876b7a3209c5dc7ef518caf3e6d4d4fea7a067e6aeb970cc96ba833d27cf4","observation_id":"0172fdfd-c0ec-48e9-b8f6-0b3c487c0e46","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:b6954c7e5930b5bfb9c063e46f65d8309afc203ca57e86534cbd3f79379b87fe","observation_id":"60736719-82c0-4c9d-8720-03d335fe16cd","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:ba35b31d7c731d8cef33074f2f8e653aa4bea5f3845ef1189235959855480659","observation_id":"09e56093-512c-44af-9d7f-df841e883179","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.08520","last_updated":"2026-05-08T22:04:48Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T22:04:48Z","title":"FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:59.400834Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.08520"},"observation_digest":"sha256:ecd5d35821dd24dce6c184175affbdf70d71c077ebfce86f485d52f30f409923","observation_id":"25b28170-02ac-4885-9097-078af6c18838","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.08862","last_updated":"2026-05-09T10:21:38Z","snapshot_observed_at":"2026-08-03T00:52:53.092284Z","submitted_at":"2026-05-09T10:21:38Z","title":"BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:23:13.071107Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.08862"},"observation_digest":"sha256:c12dc71a6e4e4fc120b55cb8b3060826cef3a2060d5546fc24dc819a2c40ac9f","observation_id":"8d917e05-0452-4a23-8e23-8177d57a79de","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.09146","last_updated":"2026-05-09T20:10:53Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:10:53Z","title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T02:58:46.728868Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.09146"},"observation_digest":"sha256:dbdf6c2a87397134ff2750094e6fd0ef218578cb03bf01bd7417e62575d35b55","observation_id":"b8030e71-5ff6-48c6-a20b-9ad790b99e42","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.12966","last_updated":"2026-05-13T04:00:43Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:00:43Z","title":"Position: Agentic AI System Is a Foreseeable Pathway to AGI","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T20:10:36.101426Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.12966"},"observation_digest":"sha256:cf36961212360a2608945c01ad879d7a65a2309c963fdc40eb53b42131b5fb8b","observation_id":"a2b86f5d-4b1c-425b-aac8-ef90ab2e10b3","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:8438202ae27a60eeee1b43cbcb989f7ba39ac9d8b8c6e7e681ae8657c24621dc","observation_id":"61174cbe-8304-48f5-95bc-82e7afc8816d","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.14220","last_updated":"2026-05-14T00:27:35Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-14T00:27:35Z","title":"Diagnosing Training Inference Mismatch in LLM Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T02:05:44.813341Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.14220"},"observation_digest":"sha256:0dec56afd29ae379dcf854c23f2c930d170a741d0bcbcb2708b43ce4512754ba","observation_id":"f2ca8497-d292-4e85-b552-d7a97237461b","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-02T16:16:00.555280Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:156117ffd2a03f6192b5a472f7effda1cfeac35a4a5ec77e7e3bbf849ed135bb","observation_id":"da7d6f53-7e64-490d-be84-ca520310e3bc","resolution":{"observed_at":"2026-05-19T18:02:42.448329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:8b4df24d5766faf8a80d821a6256ba4c3c338bd71662c0067007cb299a1f4fcf","observation_id":"83b5152c-cd27-45c1-90b1-7541046ec6ff","resolution":{"observed_at":"2026-05-20T20:13:43.758614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.18815","last_updated":"2026-05-12T09:51:28Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-12T09:51:28Z","title":"DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T23:07:18.427357Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.18815"},"observation_digest":"sha256:d1cbff9be647b6ddf8b922a0f813f6db5d69049b3662318e50aa25507fc015d8","observation_id":"4f0699d7-5473-4da1-8a3b-44716b2409f2","resolution":{"observed_at":"2026-05-20T23:09:12.222518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T07:32:12.180233Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:b32f2bedfca8e8657692346e183872bd761b6039587321a2c6ed1f312ea402ea","observation_id":"fe810c69-4791-45df-a5f5-e6c151d4e47a","resolution":{"observed_at":"2026-05-21T07:34:02.628850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T08:59:28.405218Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:816ac3b0a464c799a02ec48ac6e0ab79dd9db521efb4608cec3136bd5bfeea79","observation_id":"15a3adf2-8211-4f33-84b2-6124d127428b","resolution":{"observed_at":"2026-05-22T09:01:19.399223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-21T07:59:43.755196Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:97da3cecf5333facbba2c11d285af2e8f04313038e46f0a434558695408ad494","observation_id":"dd84ebee-5311-410b-a8cd-666e49a72249","resolution":{"observed_at":"2026-05-21T07:59:50.046588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:08.484663Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:e88dca22ecf7d82c666308cc959c351327a537eb7ccf4853d02e8affb5000595","observation_id":"f6faf070-eb05-4ad1-8e18-b5aed790f443","resolution":{"observed_at":"2026-05-25T05:50:23.726282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-03T02:25:20.739566Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T18:01:38.509794Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:c7c8c69c4c7d2ac587aa2dbe12a8530c427ede5391a20caa8a9b1c76e91eef09","observation_id":"63abdda3-635c-4f93-b652-925b21489d17","resolution":{"observed_at":"2026-06-30T18:04:57.966303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:f9fa3300d4efed0252123d4de2bc4dd79c87294d37fc2a89d9b48e91958eb8ab","observation_id":"21bb12d9-3fbd-4aec-a1a0-8f5b899e1174","resolution":{"observed_at":"2026-07-01T20:56:13.542325Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:69e269000cefb4f2afc02d3e83f5a19e52687ffc0d8661cbe977e83602ce8372","observation_id":"4c3d9624-528c-4dba-ba31-706b18038b2a","resolution":{"observed_at":"2026-07-01T21:16:13.397428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-02T12:27:06.509399Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T06:26:35.100859Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:b8295c47d9f57c9f6eaf74a3838bc1c47e3882e011383cd257faac3d42535ccb","observation_id":"912f1d9e-9ba2-49c2-a818-18da27152940","resolution":{"observed_at":"2026-07-02T07:56:47.919524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T12:27:08.279842Z","title":"AReaL: A large-scale asynchronous reinforce- ment learning system for language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-02T12:27:06.509399Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T12:27:08.279842Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:4a6d4ba41958cfeb37964599c3d54108c335db4d04393d4e4a6032db9167398a","observation_id":"00baaa07-cffa-4126-be70-b01ac06ab3a3","resolution":{"observed_at":"2026-08-02T12:27:08.279842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-03T03:32:03.287107Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:804e1b91c0b9ebea3aeb80ce896b735fc4e09b0aa97e367d796729c3ef45a94e","observation_id":"475c3c1b-5bec-4d66-b206-66aed008a67a","resolution":{"observed_at":"2026-07-02T06:06:41.093107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:e16e7f3f3b8164fd76ce626ba8dc603abd4a7c56ff3b616fcff34f1e02798e70","observation_id":"43f1bb11-1658-4ba3-8889-5204cecca945","resolution":{"observed_at":"2026-07-02T22:27:26.415608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:fa44a5ef42c58d4e6982a1cffaa42eab95cc4a7488336823eb3f8c8b9f7914e6","observation_id":"bf90f729-bc4c-4830-bad0-4c32d4ac6787","resolution":{"observed_at":"2026-07-03T09:47:59.826024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:e3e65398b9307369f78c9fd7226dbecce6e5c04bb24107415a09455c2e7cdff2","observation_id":"e5c4347e-bbdf-42ec-b2c4-c64d284cef51","resolution":{"observed_at":"2026-07-03T13:08:07.825297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:985aecf16ca81d4c039805dda92b42f92764f644a6b2927aecce339cb42ff9a6","observation_id":"aa490fe4-6ae8-453c-b334-d1b6aa5aa84f","resolution":{"observed_at":"2026-07-02T22:17:25.513987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.19004","last_updated":"2026-06-17T12:31:44Z","snapshot_observed_at":"2026-07-06T23:54:23.090538Z","submitted_at":"2026-06-17T12:31:44Z","title":"Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T19:06:16.100762Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.19004"},"observation_digest":"sha256:ad806f9b5dd4d07f302d5aa181d4f578e7e838cb357551086d887cfdae22e0d7","observation_id":"2dbde3c1-555d-477d-a89b-deda0b49132d","resolution":{"observed_at":"2026-07-04T02:49:24.703409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-04T14:50:42.006804Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T02:56:47.102678Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:6c4f2a0f55395f96676b6aad2550847adb526e756943e551e439c711b097fa38","observation_id":"7b89e743-e38f-407b-b510-32c2ae4d4f9c","resolution":{"observed_at":"2026-07-04T14:39:58.209992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-12T11:52:35.159984Z","title":"arXiv preprint arXiv:2505.24298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-04T14:50:42.006804Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T11:52:35.159984Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:9a1eb72d287a3cb27509fee25ece31225f7d6526062bdc999785b2b6f0bdfd24","observation_id":"5149cbf7-dd78-4fc9-8aef-3cc9b5dbac56","resolution":{"observed_at":"2026-07-12T11:52:35.159984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.27580","last_updated":"2026-06-25T22:12:22Z","snapshot_observed_at":"2026-08-02T08:38:09.113444Z","submitted_at":"2026-06-25T22:12:22Z","title":"Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T01:23:07.441218Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.27580"},"observation_digest":"sha256:0d09767f18f3c21bfcf7fd2f27439487df7cf54f3bf9453c4fe42c25756f2efa","observation_id":"c1d0c60b-fe75-4399-b3b0-a1d287f2b334","resolution":{"observed_at":"2026-06-29T05:43:07.654879Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2607.06763","last_updated":"2026-07-12T19:52:09Z","snapshot_observed_at":"2026-08-04T00:51:59.830713Z","submitted_at":"2026-07-07T19:48:36Z","title":"Trees from Marginals: Autoregressive drafting with factorized priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T21:49:34.512370Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.06763"},"observation_digest":"sha256:ef4193d33d83685fd282160f671fdc894cb6abd8dd780fffbcfeb6254d42020d","observation_id":"32bec269-cf7f-47ad-a24a-e0b2e9c40ea8","resolution":{"observed_at":"2026-07-10T21:57:39.209960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-14T15:58:05.356765Z","title":"AReaL: A Large­Scale Asynchronous Reinforcement Learn­ ing System for Language Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06763","last_updated":"2026-07-12T19:52:09Z","snapshot_observed_at":"2026-08-04T00:51:59.830713Z","submitted_at":"2026-07-07T19:48:36Z","title":"Trees from Marginals: Autoregressive drafting with factorized priors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T15:58:05.356765Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.06763"},"observation_digest":"sha256:358e8865d71f81dd5d3330ec40b08cfb655377c00f645f7828e9037334290aa2","observation_id":"d5e0de3a-0c46-403c-b27a-60b45309e067","resolution":{"observed_at":"2026-07-14T15:58:05.356765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2607.07508","last_updated":"2026-07-08T15:02:19Z","snapshot_observed_at":"2026-08-05T22:35:28.013349Z","submitted_at":"2026-07-08T15:02:19Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T08:51:10.098370Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.07508"},"observation_digest":"sha256:b7e3655b6b96d955704c248e612c35d93de00971ab4bef08da4b96b3453bd883","observation_id":"92f02aa6-2291-45cd-95a5-382a9e360cfa","resolution":{"observed_at":"2026-07-09T08:56:06.428422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-13T04:42:35.589143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09207","last_updated":"2026-08-05T13:11:42Z","snapshot_observed_at":"2026-08-06T17:41:22.462670Z","submitted_at":"2026-07-10T08:51:14Z","title":"Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T04:42:35.589143Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.09207"},"observation_digest":"sha256:316765f5c229454eea8a2b86d0da065dc590fd387f822ce24d6de19455f948e6","observation_id":"55ea7ddb-1643-47ed-84ce-597ab67dd347","resolution":{"observed_at":"2026-07-13T04:42:35.589143Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T06:37:37.177652Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.177652Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:a19628c3e2bf406625c5c1c1a12e138841627f2e6a9587ec2c2f4ce0a30d98c6","observation_id":"f0bd608c-2077-4856-a6e6-5c3f70d9e353","resolution":{"observed_at":"2026-08-02T06:37:37.177652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T18:29:31.579850Z","title":"arXiv:2505.24298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17299","last_updated":"2026-07-19T15:31:13Z","snapshot_observed_at":"2026-08-06T07:43:13.964458Z","submitted_at":"2026-07-19T15:31:13Z","title":"WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:29:31.579850Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.17299"},"observation_digest":"sha256:fbbfd04df8369a8d2889e93de8e8ac6ed44dea087772eb4c9e3d59976ec6a12e","observation_id":"14b69ad0-a0c3-473e-83bb-8a8b6deaf7cf","resolution":{"observed_at":"2026-08-01T18:29:31.579850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T09:49:28.853734Z","title":"AReaL : A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-06T08:38:08.188489Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.853734Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:01ca4851e0c86a594614d73546a861ffaaa810179f78a160b34e064fdcb73434","observation_id":"7f2db113-7f86-4a24-8845-7519a8acf1ce","resolution":{"observed_at":"2026-08-01T09:49:28.853734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T06:48:17.311342Z","title":"arXiv preprint arXiv:2505.24298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-05T04:38:14.706947Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.311342Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:26d7bd681dd5c4b416db48799b5701ae48e8d042d46c36d74389a8ae04ad8a92","observation_id":"4cd5dede-04e4-47e8-a00a-115009c85765","resolution":{"observed_at":"2026-08-01T06:48:17.311342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T11:13:59.560465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22614","last_updated":"2026-06-15T09:41:09Z","snapshot_observed_at":"2026-08-02T11:13:58.526737Z","submitted_at":"2026-06-15T09:41:09Z","title":"DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T11:13:59.560465Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.22614"},"observation_digest":"sha256:0ce7c1586c592ce834556cdf2277f724c899308f5003efc2927564bcfb6bad80","observation_id":"4a1c46ae-723a-478a-990e-bf9e9890cca4","resolution":{"observed_at":"2026-08-02T11:13:59.560465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24298/citation-record","integrity":"/paper/2505.24298/integrity","json":"/paper/2505.24298/citation-record.json","paper":"/paper/2505.24298"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:32e4612e96c3267b7027b46f22735648de523f555302aa3c318e053059680a3b","observation_id":"f1b5f65d-5401-46eb-a59d-e09f50458e72","resolution":{"observed_at":"2026-05-15T14:24:22.034522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b490e060ca412aebe3dcd0efef524046cd491ea2f14a50793495a1819d177b9a","observation_id":"04c98360-1a8c-4d4b-9851-275de73d2520","resolution":{"observed_at":"2026-05-15T14:24:22.024153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e8f2590-79af-491f-9142-599ba03cbebb","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:c423cd6d18249c40ca1f43274322add9570c379fa6c2ae360ef4f3ca3fcdef05","observation_id":"c68c561a-5cbb-46c8-b5b1-78b1f6320f9f","resolution":{"observed_at":"2026-05-15T14:24:22.092893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:f7da72ed3dacf2b4470efdcbd339aa59a1893faed683218a57be8f62cf9ec765","observation_id":"f6726aac-2bc3-4aa1-867d-592e16976e21","resolution":{"observed_at":"2026-05-15T14:24:22.061360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Espeholt, H","venue":null,"work_id":"c8686f95-7ff2-4fbf-b5bc-f1243774d697","year":2018},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:65f7dd6734a4bbeac2f69748b3ac7dc18edb942f988095c44fb804a3b18e28c0","observation_id":"907e8104-ed56-4057-aa42-6ef156b66393","resolution":{"observed_at":"2026-05-15T14:24:22.095148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Espeholt, R","venue":null,"work_id":"7453fc37-48f9-4807-a533-db4aeaa8651f","year":2020},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:58d7e49c57a8754546d0ee5ad951942abedff6b5184d35b279f4b23bd6323b75","observation_id":"09668f0b-c48b-454b-8315-75fc0a8cb846","resolution":{"observed_at":"2026-05-15T14:24:22.097530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hendrycks, C","venue":null,"work_id":"b4e42848-67f4-4d87-a89e-735f781d4cb9","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:3bced50e825faaaca3bfd4ff2550ba9f631d3bb21498baeb467bc8546eb84571","observation_id":"65c5e111-101c-433e-b470-277b310c206f","resolution":{"observed_at":"2026-05-15T14:24:22.099511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hilton, K","venue":null,"work_id":"078df402-9f98-4cdb-88cc-9878000addce","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:5ca40feeb2ead5958f4edf4b99d7dd54d4c11f345442a9b984010325351c1be9","observation_id":"50b91d8b-0a5f-45b3-913e-904d135b37b4","resolution":{"observed_at":"2026-05-15T14:24:22.102020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a964bf25a91b4ce2f314eadeaac6c4277b516fc1f01705829ddd66dda84a0907","observation_id":"ddd1dcba-6b8a-4ca0-9e75-122efaeeb268","resolution":{"observed_at":"2026-05-15T14:24:22.069097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5940e90-4e82-4787-8e0e-396ac731a615","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:3b634016605f577b16572f116383296a7af29c75eb478f0800ebb00aeaafc548","observation_id":"1a8ba6c0-7b7e-4f1c-a6ae-8e5caf4218e9","resolution":{"observed_at":"2026-05-15T14:24:22.104566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8dacdad-37cb-47b2-b218-2570efd547b8","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:88904f50d3722953647bdc1f4ac07251d7eac1f9d6d054899e3d394219de28da","observation_id":"d379ce49-8768-4e9f-824c-cb32e3bfe0d9","resolution":{"observed_at":"2026-05-15T14:24:22.107087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a2e6dba-1da5-4d3b-8273-66226f4eeba2","year":null},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a4155d738cc5840a92bc17d6bf44f224be6e816694c75f3c3792421c4004acc8","observation_id":"842f1a27-327f-4e04-9398-54f70b48c754","resolution":{"observed_at":"2026-05-15T14:24:22.109287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kapturowski, G","venue":null,"work_id":"cbf25ee5-7b45-48e4-a20f-c466d0989e61","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:f0af8e133596029e8377c266815f4dcd2f64e3aea9e7ca1419c9c45be1e8d132","observation_id":"006a0879-9795-4d9f-a0a4-1c4ed76a61c7","resolution":{"observed_at":"2026-05-15T14:24:22.111431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:3a02e216f868fb098b5538351875598f54785b4412394fec98f2dfaa1da3e5f4","observation_id":"2bcfd707-7ecc-45ae-9639-e65d83ae8a57","resolution":{"observed_at":"2026-05-15T14:24:21.973774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0190423a-3896-4246-99aa-29b7642ebff8","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a948137f8c07488696e6c0f4d63a86925b2727931d42626f00bc7f19dacd6b1b","observation_id":"3afe3235-b742-4fdf-9ba2-163c2ef1226f","resolution":{"observed_at":"2026-05-15T14:24:22.113383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f7ae36d-dbb2-4cf4-a491-167ba7ba1f57","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:1f3a09c909abc9a92c7e06ebc392ebba7b95288ab0dd00b345eb49da198d80cf","observation_id":"a83167a8-ffea-4f7c-80bb-72c2b906a51b","resolution":{"observed_at":"2026-05-15T14:24:22.115514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liang, R","venue":null,"work_id":"3b7c5953-7942-4b88-915a-fd426ef22207","year":2018},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:98bade433bd344a7ac49a9397019e0f5995af7c90aec9e8a9daddd8e69fb4587","observation_id":"cd3d6ccb-9aac-4db8-8979-46e7f573bb14","resolution":{"observed_at":"2026-05-15T14:24:22.118256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":"2502.01100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-07-04T18:30:01.604649Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning","venue":null,"work_id":"a87849c2-9339-401d-8ff9-7776817fe025","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:dfd11c3a11d120949dac5155a6750fcc751c65e262087f5da29224d58744ae7d","observation_id":"00c3bd1a-c9f2-4983-9911-f4b4947d08cd","resolution":{"observed_at":"2026-05-15T14:24:22.051843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f794bc97-adb0-44cc-bf84-50a80b8f9824","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0fced4c2bc651132a03068247b2ee9da9a771031dab6c865b7a7642179ef0bac","observation_id":"4c66119e-5d22-4e30-b656-2bc41e0ceaef","resolution":{"observed_at":"2026-05-15T14:24:22.120199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2c776b3d-5e98-4592-af0a-1530f75b6863","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:7c972ec4f0ba6b41c9049761d3130251643519cff7bfa48be1a526b315cefeaf","observation_id":"5b2a3e38-cc70-4796-8b56-a8489d7d4d67","resolution":{"observed_at":"2026-05-15T14:24:22.122299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"df5f3a8f-b097-4946-8af2-ba69203e8ac8","year":null},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:4c3fe65d4d94081afd02283c41aa276fb0198a431819dd8f4e987d2795b6b70e","observation_id":"bc842cf3-3971-4022-b753-e1754b602810","resolution":{"observed_at":"2026-05-15T14:24:22.124185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fdd14da8-deb7-4b10-9142-1b8feee0c2e9","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0c347f4bd62118a27cdecdde82bc1b5edcac62891ccc79c8124bea1240c889c8","observation_id":"5187a572-3c6a-49dc-b575-ee6e3fe22140","resolution":{"observed_at":"2026-05-15T14:24:22.126219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0666.365133","doi":"10.1145/3620666.3651335","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and verification","venue":null,"work_id":"787d8561-54f3-48ff-bca1-03582f84d470","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:25f69f48e14a153fec50491f002b374bc984e747fb90a07af1af764f62cf67a2","observation_id":"2fe33030-686b-40dd-a9d0-a8732103d5fa","resolution":{"observed_at":"2026-05-15T14:24:22.009165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:50:18.8352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:50:18.8352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://openai.com/index/ learning-to-reason-with-llms/","venue":null,"work_id":"6a7a5b8d-4234-429c-a441-b8d8349f3b8a","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:baa21481f450fd4006c0d1bf566a736a65efda3dc3ce4540d772f0e68786d43a","observation_id":"9ac1dd7b-70c8-4f58-a4b3-041e34200782","resolution":{"observed_at":"2026-05-15T14:24:22.128959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://openai.com/index/ introducing-o3-and-o4-mini/","venue":null,"work_id":"80a7f80c-d25a-461f-8f0b-fd702d0f0015","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:f7a383df61816a175a26bdcfb848d0e08d755245a1d226788fee35685416ceed","observation_id":"22c0fc43-2c26-490e-8a5c-a489cb6e1b09","resolution":{"observed_at":"2026-05-15T14:24:22.131543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ouyang, J","venue":null,"work_id":"03573fc9-6bfb-4bd7-b8a8-5d56fc51eff9","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b8329cb51f8aa1d2a2739d418906eefe75a61bca627482c3cd52bbfd3739c8ce","observation_id":"17be9c91-965d-422f-85f3-be94cfbb6859","resolution":{"observed_at":"2026-05-15T14:24:22.134269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9bcf8fe-c02d-4ae0-b342-9a4a3b0ccbe5","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:3447796f9b8e9b447d54a0a57c65d1846defbfa0601c7955931715f5fc737247","observation_id":"746cce49-6e19-44ed-a3ce-a0c2003f75ea","resolution":{"observed_at":"2026-05-15T14:24:22.136472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paszke, S","venue":null,"work_id":"2f2338d8-55f7-4a2d-93be-3992f51d9137","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:746374781eb2f39458134ce2da9afa4406df13d4046eb1170e6354d05e5467c3","observation_id":"ec081b8d-129c-43c1-8ab9-c91d41defadf","resolution":{"observed_at":"2026-05-15T14:24:22.071955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/9780470316887","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.010744Z","title":"Wiley Series in Probability and Statistics, Wiley (1994)","venue":"Wiley Series in Probability and Statistics","work_id":"02ff1fe9-a285-487d-a56f-1e5ddd479dd7","year":1994},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:6806a86f664d96e670e1e1823fcd993f11f03fc6374528e44e4862797754bf79","observation_id":"b34c7e4e-1a27-448a-892a-0bbd00897967","resolution":{"observed_at":"2026-05-15T14:24:22.012386Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T13:51:14.01528+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T13:51:14.01528+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-04T16:50:32.529025Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":"1405.2020","doi":"10.1109/sc41405.2020","metadata_source":"pith","pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalized Slow Roll for Tensors","venue":"astro-ph.CO","work_id":"32348cef-09e4-43f2-b53c-d785fa1937a5","year":2014},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:5991c6b146bc0bc134cd6a7f492aa88e19db270b2480b05669df38ec9b71e4db","observation_id":"4cfce521-ebf0-4a16-bfe9-efb03efa7f1c","resolution":{"observed_at":"2026-05-15T14:24:22.016165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schulman, P","venue":null,"work_id":"f7ef5471-c505-40cb-99b4-ad7a3b6cc039","year":2016},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:de61b2101e0743d2b1258ecca99aaf3d8c6d805b368478ce5d7ec3ff113d6fa6","observation_id":"75a53cec-ed67-4faf-a111-953e497e4cbf","resolution":{"observed_at":"2026-05-15T14:24:22.074665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:351fda4b31483c9310e18c066321724ded3f4aca9ae4b69066e1482963717858","observation_id":"1df6b9ad-1039-4be0-b252-ddcca0f8182d","resolution":{"observed_at":"2026-05-15T14:24:22.038379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b7cfc2df6f14f507973dd67df87117ac0052eead146b8e013b3d98d139bf9afd","observation_id":"80570ad7-d6ed-406a-8833-791c6d4c419a","resolution":{"observed_at":"2026-05-15T14:24:22.042354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369607","doi":"10.1145/3689031.3696072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"4909736c-3fe1-4820-b489-cca51669c6d2","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0e61cca7b73b0cfa447bf813f7f6911ea27010bccbeb45a774ce02f4e237b2e8","observation_id":"55dbd829-c259-4871-b28d-53e033abd762","resolution":{"observed_at":"2026-05-15T14:24:22.003970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:da67304fa1219dceb4deb189908df6c7236e0d4b220b7063f3c4c10c4624a502","observation_id":"9b490396-40b7-48ba-8703-c5eb8ac69ba5","resolution":{"observed_at":"2026-05-15T14:24:22.046981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6d6669d5-aaef-4d58-b8e0-f5b8ab9f2e1e","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:11d930af1c0f896aa47121f208e6f4efe06e6c81a834a8b0d9ef3502e19877b5","observation_id":"bf02d8bd-d30e-42e4-80c0-b9cd86e0f88e","resolution":{"observed_at":"2026-05-15T14:24:22.077208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07291","last_updated":"2025-05-12T07:24:33Z","snapshot_observed_at":"2026-07-06T21:22:21.577606Z","submitted_at":"2025-05-12T07:24:33Z","title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.07291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07291","snapshot_observed_at":"2026-07-01T20:56:13.377646Z","title":"M., Straube, J., Basra, M., Pazdera, A., Thaman, K., Ferrante, M","venue":null,"work_id":"9233b23c-abcc-4449-8d29-93e7185d2028","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2505.07291","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:5c746c4e0eb935867066b50dcd827390de192e4977600b1ee2f49b46e68f5042","observation_id":"a9bb1a91-530b-4c64-91dc-330177927b5a","resolution":{"observed_at":"2026-05-15T14:24:22.057134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"f26d8809-245a-4947-968f-d008bdce98ed","year":2017},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:990e092aed12da3948ee6305011d6ece3f932ada6926afb46c545f358198c9c9","observation_id":"ac46e50e-a781-4a67-b569-1d9158477b2e","resolution":{"observed_at":"2026-05-15T14:24:22.079530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-019-1724-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liar” ends the game, then both players reveal their dice. If the last bid is not satisﬁed, then the player who called “Liar","venue":"Nature","work_id":"c3ffdbb1-14d6-4ff7-9e3b-b49b08128fc9","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b88cf21460868a2d23ed1fc752db749507e9bcb3dcad8d8be8fcecb717658379","observation_id":"bb8f25bb-19ec-4261-b3a5-29ee5836815c","resolution":{"observed_at":"2026-05-15T14:24:21.993334Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T12:22:21.671676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T12:22:21.671676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aed0f520-348e-428b-b99e-b92a4733bddf","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:db64b551ad90cb33b5b475e618fc0ac8028f8c862df9ab2ffcae19e58665b27e","observation_id":"776aaf06-5ed0-4e76-b9fe-01a51c09984b","resolution":{"observed_at":"2026-05-15T14:24:22.081758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":"2405.14333","doi":"10.48550/arxiv.2405.14333","metadata_source":"pith","pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data.https: //arxiv.org/abs/2405.14333","venue":"cs.AI","work_id":"dbc70c01-dc01-42b7-8edc-25b7f061d5d6","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:7ff499e43e7c129b31da518dffd959fd9e85eda9f117aa554699181e463fb343","observation_id":"b991c518-178b-426d-a6ca-76576e505494","resolution":{"observed_at":"2026-05-15T14:24:22.065868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55d17d16-5fba-48a3-8f2c-9c3557fa0be5","year":2003},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:05fd2bf01588d19ca428ab68067f8768f027817c9108024480422dc556ae2c23","observation_id":"3628c109-2250-48f9-95a8-63f07031ee6a","resolution":{"observed_at":"2026-05-15T14:24:22.083916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/10968987","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Job Scheduling Strategies for Parallel Processing pp 44–60","venue":null,"work_id":"eb6ecc72-65fd-470f-a23c-0c93fa1f7725","year":2003},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:52805d68767f9aaeb1334671d2253532696478f4f929d815c55a756ecdc4a76b","observation_id":"ed6d1c0e-4631-41c4-aa10-076c7defaa9f","resolution":{"observed_at":"2026-05-15T14:24:21.978165Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:911fe01cfdc4e7532b46c7a6f3570607c981cd7fd216e9af8083adf75bf4b3ce","observation_id":"79e61d0b-a2c8-4729-9c60-20162a21aa35","resolution":{"observed_at":"2026-05-15T14:24:21.986322Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:7652604235456900a840288995498d50101d7bed2b86deba3d3e66209a3c701e","observation_id":"4fd6d89d-55ff-46da-b1b7-fae958d9c605","resolution":{"observed_at":"2026-05-15T14:24:22.020162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1540.361156","doi":"10.14778/3611540.3611569","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"I am EdgeRunner AI","venue":"Proceedings of the VLDB Endowment","work_id":"2fecc4e1-0d3a-4003-bd43-23d1f5da5be2","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:77ac74efcd8ed8712f1fee6ecd8eb26181fc066884286663e4cf33d3ab1e3b4d","observation_id":"e28f579a-43c0-4b89-bbaf-fd5e5bc8e433","resolution":{"observed_at":"2026-05-15T14:24:21.999394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:03.068603+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:03.068603+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zheng, L","venue":null,"work_id":"77a8cf65-4325-43a1-b4ec-774810767e64","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:f4fc955fc1cafc7e142b17e44d4337c061aa2278553b5e0558622119949e4629","observation_id":"52324d64-6c04-4d1f-801f-61360ca221ce","resolution":{"observed_at":"2026-05-15T14:24:22.086140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-07-06T21:13:04.549829Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":"ArXiv.org","work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0d2b2eef311273e68b9be6b664c60797a7c9c3e627e413463331452750db6090","observation_id":"59953177-8abe-4da9-bdfe-30c73e0f5279","resolution":{"observed_at":"2026-05-15T14:24:22.029099Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"15c1c53c-e7c4-4531-8823-3d7058d411c3","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a3aa5ca3762e2314d10f7760355fd357daaf2430cc398ebf975dc10eda6e5ece","observation_id":"ef40b99f-46ba-4556-bd29-cd07bb5f073d","resolution":{"observed_at":"2026-05-15T14:24:22.088384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For most of the results, we use SGLang [63] v0.4.6 as generation backend and pytorch FSDP [ 62] as training backend","venue":null,"work_id":"2d6c7d88-04c8-4d4f-85f1-673edeed1f57","year":1911},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:ad5065aa48d8912cc94e92b2989099133d137ce806210e0c9d9794e63d75737c","observation_id":"d73722ed-f188-4954-af71-82d1754581e9","resolution":{"observed_at":"2026-05-15T14:24:22.090551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":14,"verified_exact":15,"verified_fuzzy":15},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 73 inbound Pith citation observations for arXiv:2505.24298."}