{"as_of":"2026-08-05T08:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f293c3b53863906cc477580078135b40f53d41cc24fed681327445b433d40d4e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:53:02.690293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2508.07407","last_updated":"2025-08-31T14:55:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-10T16:07:32Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T23:21:42.029285Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2508.07407"},"observation_digest":"sha256:dcd0265398e30644b24bfbcd6f7c3acb7a2df742d36267aff9e3ac3937ff104c","observation_id":"7ffd83e3-7cfb-4c48-9a3d-49d730adcb66","resolution":{"observed_at":"2026-05-15T23:21:42.452862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:6e8e6012293531f0e47b4271d3bda53939a52e1d175100569616dc5ca87e4b31","observation_id":"57a2e0cc-3889-4def-a8ff-f498295de558","resolution":{"observed_at":"2026-05-18T19:21:48.062708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:f4c588d395c07df1253885cdc53bcbd81c868d994b9eba4c5905010df36a7984","observation_id":"796cf684-1dd7-49c3-b966-fc4b361d7b33","resolution":{"observed_at":"2026-05-18T00:05:31.510709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T18:53:02.690293Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.690293Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:525f9218a4d92b22ba4254266ad310b62f8b87a7730c20b3e3338172dfb8d448","observation_id":"edf8c7ba-09fc-4dea-9987-691406fe9548","resolution":{"observed_at":"2026-08-04T18:53:02.690293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2509.14274","last_updated":"2026-06-29T08:48:10Z","snapshot_observed_at":"2026-08-04T16:40:58.811345Z","submitted_at":"2025-09-16T06:48:11Z","title":"Discovering New Theorems via LLMs with In-Context Proof Learning in Lean","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T16:09:39.975762Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.14274"},"observation_digest":"sha256:e16eb44108e0ff4e1c05ab41dbb5f4bd6b8cf5b12b8cb7009d511708151ebedb","observation_id":"57362e68-6424-4f58-8c70-6cc0d954ae4e","resolution":{"observed_at":"2026-05-18T16:11:35.906950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T16:40:59.805198Z","title":"R-zero: Self-evolving reasoning LLM from zero data.arXiv preprint arXiv:2508.05004, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14274","last_updated":"2026-06-29T08:48:10Z","snapshot_observed_at":"2026-08-04T16:40:58.811345Z","submitted_at":"2025-09-16T06:48:11Z","title":"Discovering New Theorems via LLMs with In-Context Proof Learning in Lean","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:40:59.805198Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.14274"},"observation_digest":"sha256:51b51563906d8ade73ac555e334e9f3f36065f03caa61d8fb4b6a524ed1f6289","observation_id":"474f9f6f-50e2-4e5d-8757-d82d4147407c","resolution":{"observed_at":"2026-08-04T16:40:59.805198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T10:44:30.568947Z","title":"R-zero: Self-evolving reasoning llm from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-04T10:44:27.363839Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:30.568947Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:74ad799c80b6128428d7e73a99b415646284687fb299c346361909614797766d","observation_id":"932533c3-59a2-49ea-953d-ae24d7618eb6","resolution":{"observed_at":"2026-08-04T10:44:30.568947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T08:55:58.613740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-04T08:55:55.274164Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.613740Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:ee30af1bfe6f88116c9864bbf8e2e42a408c49f6eae79369d889d3b1b0ae70ec","observation_id":"91a79947-b1bb-4788-9a65-e5b761eee3d8","resolution":{"observed_at":"2026-08-04T08:55:58.613740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2511.09907","last_updated":"2026-05-08T08:34:38Z","snapshot_observed_at":"2026-07-06T22:35:41.533403Z","submitted_at":"2025-11-13T03:08:51Z","title":"Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T22:59:48.260121Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2511.09907"},"observation_digest":"sha256:371be8c38ff41ee2a8d15d2ed289b36f4030d0593e69459039cf0396d5eec29f","observation_id":"741c5291-7bb4-4b1e-a06d-918a2738ab69","resolution":{"observed_at":"2026-05-17T23:00:25.510812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2512.18552","last_updated":"2026-06-02T06:06:43Z","snapshot_observed_at":"2026-08-03T15:02:08.953642Z","submitted_at":"2025-12-21T00:49:40Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T16:07:48.570995Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2512.18552"},"observation_digest":"sha256:73127733e29637489a0200571eb1cbba6a52f9aad9fe219a901884dd200db437","observation_id":"044c5688-07a5-4fa4-8a99-bebeebdfb7e4","resolution":{"observed_at":"2026-05-21T16:10:20.187627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-03T15:02:11.420780Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18552","last_updated":"2026-06-02T06:06:43Z","snapshot_observed_at":"2026-08-03T15:02:08.953642Z","submitted_at":"2025-12-21T00:49:40Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T15:02:11.420780Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2512.18552"},"observation_digest":"sha256:356a562c00077916c9f2a2b1b09ef5a8fb05756e1f8b6567136151dbdb6be3d9","observation_id":"db63c098-f3df-4d55-b2d6-650361f6e571","resolution":{"observed_at":"2026-08-03T15:02:11.420780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-03T07:59:09.641194Z","title":"Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Thai, Junhao Shen, Jinyi Hu, Xu Han, Yujie Huang, Yuxiang Zhang, Jie Liu, Lei Qi, Zhiyuan Liu, and Maosong Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.18778","last_updated":"2026-06-30T17:43:05Z","snapshot_observed_at":"2026-08-03T07:59:03.669663Z","submitted_at":"2026-01-26T18:46:56Z","title":"Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T07:59:09.641194Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2601.18778"},"observation_digest":"sha256:48305986d90a7661f8b40d336f6f874d5ce58911d2c233e6f15b76908d2de8a9","observation_id":"f181ed9d-8a1a-46cf-81c3-667feceb3c80","resolution":{"observed_at":"2026-08-03T07:59:09.641194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-03T05:14:18.752065Z","title":"R-zero: Self-evolving reasoning llm from zero data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.752065Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:95f79ca796762ad5f66159ed671de52c01d1f99ac189ecfe4c867255992c0c37","observation_id":"5fb056ad-3db9-455a-9ba4-619a857ff0e8","resolution":{"observed_at":"2026-08-03T05:14:18.752065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2603.08403","last_updated":"2026-05-21T13:59:14Z","snapshot_observed_at":"2026-07-06T22:48:21.803560Z","submitted_at":"2026-03-09T14:00:36Z","title":"SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T11:14:47.943242Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2603.08403"},"observation_digest":"sha256:a893278a547dcc50f86569434649d8a8ad820e67aa7e16e243e3df486b6c1d5d","observation_id":"ae2e50ca-c6aa-4988-bb67-c7def6526d50","resolution":{"observed_at":"2026-05-22T11:16:27.869604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-13T14:05:26.303000Z","title":"R-zero: Self-evolving reasoning llm from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01985","last_updated":"2026-05-29T16:27:50Z","snapshot_observed_at":"2026-07-13T14:05:19.455452Z","submitted_at":"2026-04-02T12:48:36Z","title":"World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T14:05:26.303000Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.01985"},"observation_digest":"sha256:163af29258b11c71db5e287e259de8680629ebaac79fbed08905c59921759dcd","observation_id":"de9d955b-a5f3-4887-838a-7fde5a6f3931","resolution":{"observed_at":"2026-07-13T14:05:26.303000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-02T22:11:20.734730Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T19:23:10.901441Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:a09508c611d2d800f1b1d737fccdd0cd4bdbd08f2e941d7ac382b72e9c707914","observation_id":"b99aa7a5-79d3-4d97-9221-2dfc48fc9928","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-02T16:52:27.075292Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-02T22:11:20.734730Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:27.075292Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:5b129b3260dcb4b6da8fd53f6c194efe08082438cd3b1c62785c1263bea4e7d6","observation_id":"c7cc9655-90f8-4692-a39b-64e4152b662a","resolution":{"observed_at":"2026-08-02T16:52:27.075292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.07864","last_updated":"2026-06-28T14:24:43Z","snapshot_observed_at":"2026-07-13T00:12:30.852396Z","submitted_at":"2026-04-09T06:24:54Z","title":"ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:23.127141Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.07864"},"observation_digest":"sha256:243fe1ff4493a0f6a1ff870f92aa41a38fc5d38052cc1c8e3c0dea65f42a4b86","observation_id":"4c144cfb-1d2a-4d57-8ae8-1ac2eff2f40a","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.14054","last_updated":"2026-05-25T13:50:41Z","snapshot_observed_at":"2026-08-02T01:13:47.904200Z","submitted_at":"2026-04-15T16:34:39Z","title":"$\\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:09.581054Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.14054"},"observation_digest":"sha256:1e3f7ffa470738c7ef98deee52e6ff3f0d218104931e6bc5346a3e89c89855ab","observation_id":"84f7baea-ea9a-4fb2-b508-457c9e3f8b59","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.16322","last_updated":"2026-02-27T21:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-27T21:31:41Z","title":"Steerable Instruction Following Coding Data Synthesis with Actor-Parametric Schema Co-Evolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:00:39.404711Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.16322"},"observation_digest":"sha256:5cae62d392fab73f1e59052ef3ac0c8d18a39d647f67ecc242dc1d5ca2c10dd2","observation_id":"b37f44fe-de8e-4400-b5e9-1abd1a9f6aff","resolution":{"observed_at":"2026-05-15T18:01:25.355541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:3145e95cc503ddeb284e9e61456d0e19612f03cfb9681f09b990c65697bc04dc","observation_id":"54e23510-0c45-4faf-b93e-b18794bb4407","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:08fdabb1936fa6fe0eda33ce992eb4da7f4a24c49ea8056db06669aa9e91930f","observation_id":"fb71f621-e6c8-4b55-ae8b-dba0204d34ac","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.18320","last_updated":"2026-04-20T14:20:44Z","snapshot_observed_at":"2026-08-02T05:38:32.357591Z","submitted_at":"2026-04-20T14:20:44Z","title":"EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T05:23:45.814042Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.18320"},"observation_digest":"sha256:b0247dc1e449ccb1094aef7012a30ffc431dda1eb3280659cb5fe74acd8f03dc","observation_id":"b9f99459-8eb9-416b-800c-218163730cde","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:9e69d7396406c6e4fe3d7750fb0c7b80f60e40b15e61b03b27ab0577b4ccefbe","observation_id":"a77039c5-391b-46f0-961b-c9bd3e6d4e0a","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:bcaba183948e43fd653af19150455f7980514a8dbce46f864bff2aea9e7e4ced","observation_id":"139dcdf1-28f7-49d8-b460-4252fe0181bc","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4431d696a7fbd7be33cdfe71db0119f3d936720df79d2c5b6d9be5e252303508","observation_id":"16ef9c3e-12c6-4542-bc13-dc746c5cc050","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.20209","last_updated":"2026-04-22T05:50:23Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T05:50:23Z","title":"Scaling Self-Play with Self-Guidance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T01:31:06.090698Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.20209"},"observation_digest":"sha256:a7f1b676e8eb2c75d2f1f09f773aad42383009a75c79e6d9300d7c351bb8a6be","observation_id":"7fbb6323-6cbd-42f8-8566-5047837d1244","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.20987","last_updated":"2026-04-22T18:17:17Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T18:17:17Z","title":"Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:07.017420Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.20987"},"observation_digest":"sha256:80ef879a8c6a9cc0d8825764b27f4e6ea48e31cc43e24c75a12f2e77995b9393","observation_id":"fdc49f2b-a5bf-455b-a401-5188d88780ef","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.24819","last_updated":"2026-04-27T14:05:18Z","snapshot_observed_at":"2026-08-03T03:44:08.503208Z","submitted_at":"2026-04-27T14:05:18Z","title":"Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:30.648190Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.24819"},"observation_digest":"sha256:7ba1dc743933486a2d992020a85765f6337a3eb0db3473f6c8fc5431bbf348f2","observation_id":"960ef2ab-9b7b-4104-8d51-5c881c005fff","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.05546","last_updated":"2026-05-07T00:51:36Z","snapshot_observed_at":"2026-08-02T08:41:09.790853Z","submitted_at":"2026-05-07T00:51:36Z","title":"SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T12:12:33.179209Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.05546"},"observation_digest":"sha256:de3e97aa444adc88fcdd2b4ea6eea543bc21c38eea553f6fdc3b802967141b11","observation_id":"b24d2392-11a6-4c58-b721-c98fc46a8d8b","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-08T09:35:47.501360Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:5639703685809d9378999181f96b4eaa532099d4d9bb07a26f2bceebd7c3a6bf","observation_id":"604e6e14-bd70-4c97-a5a5-01705bd5de45","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T03:16:59.195706Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:10d6a56c9736a733d1c88ca4193f111723e132234ce9dd6133894e2f6e05b67e","observation_id":"7c4eb9bb-3fb9-4251-9a74-43b6899b805c","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.06638","last_updated":"2026-05-16T04:00:46Z","snapshot_observed_at":"2026-08-01T16:33:10.395761Z","submitted_at":"2026-05-07T17:48:42Z","title":"Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-20T22:36:13.781114Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.06638"},"observation_digest":"sha256:47cd752d1ec904b0342fe3f484ccb5f4210799eac1210eace5174e2ed95954b3","observation_id":"3120205c-3e8b-4338-9a4a-72f079c2ab90","resolution":{"observed_at":"2026-05-20T22:39:10.263076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.07465","last_updated":"2026-05-08T09:13:12Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:13:12Z","title":"SEIF: Self-Evolving Reinforcement Learning for Instruction Following","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:09.514927Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.07465"},"observation_digest":"sha256:1c5a567cff27b91cbded21dc4124f369959ad37b2c82623038f4969ee805f5ec","observation_id":"6c9dd457-c504-4db6-a2f5-5f4fe398d035","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:44.087943Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:25e0cfa31c82cf23bace0ffa959613df725eafdfc010b37982637828a090f740","observation_id":"f74eb4b1-c84d-4c0e-a2e8-47da77a058c5","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T21:30:42.766390Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:8048d9d6f2606f48b5e7e7e1e70c4455df749fef947159a33c8ebd148fe905db","observation_id":"b6393cb0-1633-4ca8-b4b4-4b2b0f8da891","resolution":{"observed_at":"2026-05-14T21:32:59.661454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a90dff96c172fc303f850dd5881e31328504b7a0156f30b188de2e830439219f","observation_id":"00663b6f-c180-4836-998f-9ced3017c357","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:ca28b9d0e20d41519d0b5af28dcbdf12513591d47b1417e903a02166f16184c7","observation_id":"eaaf08fe-e3dc-4698-9ce6-01f8d9783417","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:10.263663Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:0db89600fbd89cc8612477601eb058a646cc11d2ddfd51a63a0b745b4d624828","observation_id":"920ac4a3-4216-42b5-b86e-8fb209623b34","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.11679","last_updated":"2026-05-13T09:28:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:38:59Z","title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:06.989077Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.11679"},"observation_digest":"sha256:8f136d0e769dbc3e87a8a1f73670bf55e4b95d3bb15f2177e4723481d2139114","observation_id":"00aac77a-2ba8-455f-9d51-171fd7248d4f","resolution":{"observed_at":"2026-05-14T21:12:58.803288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.13369","last_updated":"2026-05-14T02:40:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:27:40Z","title":"Query-Conditioned Test-Time Self-Training for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T20:04:51.248797Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.13369"},"observation_digest":"sha256:72a87cfa374ff475e9abba0143493789ada5626a9e56a782e439e59706d117eb","observation_id":"063ab454-8f56-48ee-af88-5b7bf9ce10d5","resolution":{"observed_at":"2026-05-14T20:07:54.177291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.13369","last_updated":"2026-05-14T02:40:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:27:40Z","title":"Query-Conditioned Test-Time Self-Training for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T05:53:42.235498Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.13369"},"observation_digest":"sha256:27dee2fdbb1aa5ecebd55059b0dd97b2b63c77eba1440318215e6f580a5bd57d","observation_id":"d87134a8-2484-40c5-9d8b-c6b62e397dac","resolution":{"observed_at":"2026-05-15T05:55:04.920434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:ee561835af7a6c47e22a79def293ecd60bb4000b19ff41165ceaf4208dce8b88","observation_id":"b43fa50d-6427-4a74-86e8-abc49f43c51c","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:feda98c3a739d00af2c254f4450474afb359aa31fd97cca909cf4e877b51bedb","observation_id":"824f0c7d-fdea-4f21-9a3d-5d062c17a7e9","resolution":{"observed_at":"2026-05-14T19:32:52.558475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.13880","last_updated":"2026-05-11T04:34:43Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-11T04:34:43Z","title":"PREPING: Building Agent Memory without Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T06:14:14.385586Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.13880"},"observation_digest":"sha256:965fbdf77f8fb966586e081fd1deef4cb04c8011327340d92c395a4e495190e1","observation_id":"0d83bc4c-5dc6-41b2-bdc2-46c538c91a52","resolution":{"observed_at":"2026-05-15T06:15:06.068820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:1d377e69b6aa3484c1873090cef66174a2f4a6ad2fd6f033179ed65a8ab3ab77","observation_id":"e35b5a32-7a9b-4e6d-a465-a6fe29d55074","resolution":{"observed_at":"2026-06-30T21:05:04.695285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:7f85faa5533db1381d5537ee0411c100f43c723417386675beefe198d6383d86","observation_id":"216acf16-d54c-4aba-8334-00ae124539ab","resolution":{"observed_at":"2026-06-30T21:35:04.459746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.16727","last_updated":"2026-05-16T00:29:35Z","snapshot_observed_at":"2026-08-01T05:36:54.753419Z","submitted_at":"2026-05-16T00:29:35Z","title":"PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-19T21:37:56.570173Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.16727"},"observation_digest":"sha256:dd8fcd220642cc84a291762bea1aa5a81249912ca6c767bc50409fff02f02357","observation_id":"95b23f76-a377-4462-9e73-9fcce8fc7a87","resolution":{"observed_at":"2026-05-19T21:42:48.064691Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.17037","last_updated":"2026-05-16T15:16:00Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T15:16:00Z","title":"D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-19T20:21:48.657926Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.17037"},"observation_digest":"sha256:dabde89f103e33312a8d4bb2e72d02a3bd2a8a3264a826a18b3ac609321513f6","observation_id":"4beb94bf-65ed-49a4-9ccb-b64b56aa9530","resolution":{"observed_at":"2026-05-19T20:22:45.321883Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:4c1813aff2b10d4c79833c90a95707f3a357bec85fc6f8c2336384da581fac3c","observation_id":"669dc081-7464-44e6-ac44-502f597fbf8d","resolution":{"observed_at":"2026-05-21T11:24:08.702410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:3d470be4bab3831b400eed74cc4e3be2bb2cde1675ec717a27a294cda693c879","observation_id":"fbd7d8fb-b6e0-49cc-bcdb-2fc0dc63228a","resolution":{"observed_at":"2026-05-21T05:39:40.526852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:b159fa12eae253983f8642815b024b1a987f23629dee3ef26b5ee5a0b643319d","observation_id":"8ebaf286-a748-40bf-bb15-4ff6f62b0c77","resolution":{"observed_at":"2026-06-30T17:24:57.539081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.21931","last_updated":"2026-05-21T03:00:35Z","snapshot_observed_at":"2026-08-04T00:34:51.754881Z","submitted_at":"2026-05-21T03:00:35Z","title":"EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:30.508843Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.21931"},"observation_digest":"sha256:8bc52a9fbd00d30d4ec4ea02a14500d3850e73d70ea90a6f0779eb5f67c74466","observation_id":"6b148deb-c6b4-41e5-9cfe-28af6f4d40dd","resolution":{"observed_at":"2026-05-22T07:21:12.892617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.22905","last_updated":"2026-05-21T17:47:01Z","snapshot_observed_at":"2026-07-06T23:33:09.561760Z","submitted_at":"2026-05-21T17:47:01Z","title":"EVE-Agent: Evidence-Verifiable Self-Evolving Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:42.464591Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.22905"},"observation_digest":"sha256:a1119cc627e5f7d57e2810fd25e0b6a0b7d81cf73d9a7e14e9b7c8dac4d32b4d","observation_id":"6560bc44-3af0-4966-a5f8-ff2982c7974b","resolution":{"observed_at":"2026-05-25T05:45:23.884847Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.24426","last_updated":"2026-05-23T06:41:31Z","snapshot_observed_at":"2026-07-06T23:34:28.608412Z","submitted_at":"2026-05-23T06:41:31Z","title":"SEAL: Synergistic Co-Evolution of Agents and Learning Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:38:10.466713Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.24426"},"observation_digest":"sha256:8e630d7c6652c64d46036a7315344aea1fe8ef1804f5f5e6afad03f237c0c45d","observation_id":"e0a71aea-cdbb-47a8-b932-9d331bf073d4","resolution":{"observed_at":"2026-06-30T13:44:40.924437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.30105","last_updated":"2026-05-28T15:46:58Z","snapshot_observed_at":"2026-08-01T01:43:11.359286Z","submitted_at":"2026-05-28T15:46:58Z","title":"EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T06:16:51.531156Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.30105"},"observation_digest":"sha256:3a3ef87fd3fa1dcd3a583493ef00c457f5bb3d6e711f59673e00db153786f4ae","observation_id":"d3de43ee-4577-4c37-8e21-dff00f932eff","resolution":{"observed_at":"2026-06-29T14:43:31.661411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:8b3a70d3f0db4c1b28443fcdeaeaef7a47284477a58028cf8f48989e88a42758","observation_id":"a8cc42b5-a8b8-445a-be2a-df5579d060f6","resolution":{"observed_at":"2026-07-01T20:56:13.592288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.01286","last_updated":"2026-05-31T15:12:16Z","snapshot_observed_at":"2026-08-03T00:41:34.020605Z","submitted_at":"2026-05-31T15:12:16Z","title":"BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T16:49:50.653594Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.01286"},"observation_digest":"sha256:500f8153a7849d0fc47ce9f4f2dea3d00a57a7886aaacbea3e2789b4b90e2c36","observation_id":"d1a69c57-a417-4519-9948-de4129734026","resolution":{"observed_at":"2026-07-01T21:36:14.649137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-02T21:19:39.471703Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:a8a60574fb6a557f00a465b7d828b35a95b8a6e6da44926d0a84a08723bcfc9e","observation_id":"9cc9bac4-8ee7-46e7-a7d2-dc24d144180f","resolution":{"observed_at":"2026-07-02T02:56:29.137790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-02T07:41:20.436955Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:b04df2ad1a821043f38e7af143b9a610efad1a32643c44bd764e754bfc5aa340","observation_id":"695c6a50-058e-4f03-8d15-ee2a1f6d02fa","resolution":{"observed_at":"2026-07-02T02:26:27.250046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.04703","last_updated":"2026-06-03T10:30:09Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:30:09Z","title":"Rethinking Continual Experience Internalization for Self-Evolving LLM Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T06:29:11.398007Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.04703"},"observation_digest":"sha256:7a0c59f7a25cec910499d35685106e6d87ab62c4fb848798ebb9d215b740b119","observation_id":"b3b74462-1ca5-4b8f-9ce6-de9ed6b75ccb","resolution":{"observed_at":"2026-07-02T07:56:47.775685Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.06114","last_updated":"2026-06-04T13:03:16Z","snapshot_observed_at":"2026-08-03T19:36:11.425907Z","submitted_at":"2026-06-04T13:03:16Z","title":"Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T01:33:39.607334Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.06114"},"observation_digest":"sha256:81c0f657f793ea138782f57b030271d1b285e64cd1b8a58dfcc8908ab11edba0","observation_id":"2c90d88c-e40e-4fcb-9e07-285b7087ff05","resolution":{"observed_at":"2026-07-02T13:06:59.488782Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-05T04:59:46.668803Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:78455d7429a734dabde3b4364102c4d570284e99be8c312a1ff14088b96ffc2f","observation_id":"1095b9c6-65b2-46ca-8d40-2537da836808","resolution":{"observed_at":"2026-07-03T14:58:33.224115Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-01T05:53:08.805029Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:fce810679f4157ffe521181d33887f063c7f107948e8aeb40e3936c64c3295a7","observation_id":"2cefef41-87fc-4502-8d1b-c1d94c72d276","resolution":{"observed_at":"2026-07-03T20:58:58.300001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:158f792be8875a0035dcf60b73eae2044a1d42a8e5bddc775f20e7191cbf6d81","observation_id":"fb9e5769-20cf-4bb0-9e43-29e2eb5fca8d","resolution":{"observed_at":"2026-07-04T08:39:42.309663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2607.01480","last_updated":"2026-07-01T21:20:57Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T21:20:57Z","title":"Procedural Memory Distillation: Online Reflection for Self-Improving Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T20:12:06.882343Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.01480"},"observation_digest":"sha256:a9781707e7e8a1e28646fceb8606152bf43711054ee1f5ccf5155338da7f1759","observation_id":"a11baa40-fae8-46b3-9765-17eafbc1ebf7","resolution":{"observed_at":"2026-07-03T20:18:56.024959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-12T09:29:14.105502Z","title":"arXiv preprint arXiv:2508.05004 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02592","last_updated":"2026-07-01T07:37:10Z","snapshot_observed_at":"2026-08-02T20:40:02.595243Z","submitted_at":"2026-07-01T07:37:10Z","title":"H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T09:29:14.105502Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.02592"},"observation_digest":"sha256:08cb9743deb5a177099ac97cbac47d27dfd65756401f9b57c0875268eaf88ca8","observation_id":"807d88c5-6a1c-4eb1-9b2d-bbf29a9b926c","resolution":{"observed_at":"2026-07-12T09:29:14.105502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-12T01:53:44.674517Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03523","last_updated":"2026-07-03T17:51:52Z","snapshot_observed_at":"2026-08-02T05:09:12.896857Z","submitted_at":"2026-07-03T17:51:52Z","title":"Anchored Self-Play for Code Repair","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T01:53:44.674517Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.03523"},"observation_digest":"sha256:51925c60262a742ba0bb12ffbd13417be806364416bd88ed3796a631d5a3bc5b","observation_id":"4ea526f4-4baf-4b47-8ca6-1109d0908eb5","resolution":{"observed_at":"2026-07-12T01:53:44.674517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-11T19:23:10.328625Z","title":"R-zero: Self-evolving reasoning LLM from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04412","last_updated":"2026-07-05T17:05:13Z","snapshot_observed_at":"2026-08-03T01:58:29.277654Z","submitted_at":"2026-07-05T17:05:13Z","title":"LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T19:23:10.328625Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.04412"},"observation_digest":"sha256:151049853d216d74b7c06d1416998da793ed7850829c42025a98b613536582d6","observation_id":"10135b71-3735-4e28-ad15-dad414f60591","resolution":{"observed_at":"2026-07-11T19:23:10.328625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2607.07663","last_updated":"2026-07-08T17:19:50Z","snapshot_observed_at":"2026-07-30T01:44:04.256851Z","submitted_at":"2026-07-08T17:19:50Z","title":"Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T03:36:57.168246Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.07663"},"observation_digest":"sha256:e12f1b60eaf08e8e1d8810cd5a33543018d421548803da892d528e46d94f2f1b","observation_id":"d1e883d4-5917-4f10-98a4-694c69c58a7f","resolution":{"observed_at":"2026-07-09T03:45:55.692092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2607.07690","last_updated":"2026-07-08T17:49:14Z","snapshot_observed_at":"2026-08-03T14:09:50.236027Z","submitted_at":"2026-07-08T17:49:14Z","title":"Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T02:29:12.366018Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.07690"},"observation_digest":"sha256:d1677594b6468b79f219fc062462a0cd7269cd6d23ef5cdd59882006a35f23ed","observation_id":"3dc2e27f-1376-472d-9505-122daa81c3d4","resolution":{"observed_at":"2026-07-09T02:35:53.849536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2607.07779","last_updated":"2026-07-08T17:46:36Z","snapshot_observed_at":"2026-07-12T23:17:59.879344Z","submitted_at":"2026-07-08T17:46:36Z","title":"From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-07-10T18:16:31.176239Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.07779"},"observation_digest":"sha256:6acfc414b0ef1f07b4a50d151f0b9090742f35915a3f185b103ad2ad8d9c8a2a","observation_id":"ebb69f22-ad95-466f-9db2-ab927f9b2f85","resolution":{"observed_at":"2026-07-10T18:17:33.698445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-01T10:40:25.890871Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20166","last_updated":"2026-07-22T14:03:25Z","snapshot_observed_at":"2026-08-01T17:31:59.984600Z","submitted_at":"2026-07-22T14:03:25Z","title":"Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:40:25.890871Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.20166"},"observation_digest":"sha256:052bcfbabf6e087b2f9a0c4dda366ab596671b69321d928e68e4abeddf659bd4","observation_id":"fc197c8c-d538-4e0f-b32b-15e76bae5ea2","resolution":{"observed_at":"2026-08-01T10:40:25.890871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-01T04:28:45.732564Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22529","last_updated":"2026-07-24T17:59:22Z","snapshot_observed_at":"2026-08-01T04:28:42.700487Z","submitted_at":"2026-07-24T17:59:22Z","title":"Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T04:28:45.732564Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.22529"},"observation_digest":"sha256:cd13ade0eb154fcabf97ed3ea2d733431f20cf558a807156efa20a8fe5dae87a","observation_id":"d0f755cd-4170-43dd-ac7a-4442881dbc90","resolution":{"observed_at":"2026-08-01T04:28:45.732564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-31T01:39:47.105486Z","title":"Huang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25090","last_updated":"2026-07-27T21:30:39Z","snapshot_observed_at":"2026-08-03T01:32:45.260967Z","submitted_at":"2026-07-27T21:30:39Z","title":"Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T01:39:47.105486Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2607.25090"},"observation_digest":"sha256:e9800efa862ffc4bc09c836d481dd30579b9d9816deeb7c4f78cab12b487283b","observation_id":"2273c5e5-9c33-4e6b-8e1b-f6694a665b93","resolution":{"observed_at":"2026-07-31T01:39:47.105486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05004/citation-record","integrity":"/paper/2508.05004/integrity","json":"/paper/2508.05004/citation-record.json","paper":"/paper/2508.05004"},"outbound":[],"paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 75 inbound Pith citation observations for arXiv:2508.05004."}