{"as_of":"2026-08-03T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b02486688eae29d75722f7197abce3b51a568657bc702547b9ee75f030d3c9b3","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:39:40.780801Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T18:33:28.493350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:45:55.708592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"cited_work":{"arxiv_id":"2605.09959","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.09959","snapshot_observed_at":"2026-07-09T03:45:55.708592Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","venue":"cs.LG","work_id":"f787b80b-351d-4564-8835-28ebe7226325","year":2026},"citing_paper":{"arxiv_id":"2607.07663","last_updated":"2026-07-08T17:19:50Z","snapshot_observed_at":"2026-07-30T01:44:04.256851Z","submitted_at":"2026-07-08T17:19:50Z","title":"Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-07-09T03:36:57.168246Z"},"links":{"cited_paper":"/paper/2605.09959","citing_paper":"/paper/2607.07663"},"observation_digest":"sha256:8a871d98307c50883ef00e888d6f4006b0dac5abc35a6ae849c5e1eeefd47f64","observation_id":"8e636395-6e99-48a7-bad2-df97c3671a52","resolution":{"observed_at":"2026-07-09T03:45:55.709795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09959","snapshot_observed_at":"2026-07-30T18:33:28.493350Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-29T13:03:07Z","snapshot_observed_at":"2026-08-02T15:02:47.562494Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.493350Z"},"links":{"cited_paper":"/paper/2605.09959","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:e9ee05d4895a245cd8274f217f125a5266790c98892970e5bac26b42b5028fe1","observation_id":"110f500a-8414-4793-aa78-b431ad1af83f","resolution":{"observed_at":"2026-07-30T18:33:28.493350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.09959/citation-record","integrity":"/paper/2605.09959/integrity","json":"/paper/2605.09959/citation-record.json","paper":"/paper/2605.09959"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-07-06T21:15:21.546083Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:793f36583db959fd1b3d004edef5bd6397172c843e1562a96501d8a545a926f5","observation_id":"a0bca19f-eea2-4e01-97e0-3a4d26c32514","resolution":{"observed_at":"2026-05-12T07:11:24.388622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:9118330601c396b281271d67b5cde565624bc89ed709462dc184377cd9a1a421","observation_id":"9fbd0733-d719-4076-b473-b0e906b14996","resolution":{"observed_at":"2026-05-14T23:00:22.024625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":"2404.04475","doi":"10.48550/arxiv.2404.04475","metadata_source":"pith","pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","venue":"cs.LG","work_id":"ef25adcf-addb-445e-b3b5-858eeb9883ca","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:f454bf92c39f0e05883794439fb3979e5f6f362bc96aeb79de60ac740c1703eb","observation_id":"31459089-a7f6-43eb-9146-0701db6d5c45","resolution":{"observed_at":"2026-05-12T11:13:05.519270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20347","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.670758Z","title":"Serl: Self-play reinforcement learning for large language models with limited data","venue":null,"work_id":"504cbf18-21bd-46c7-81c6-de09bc479215","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:4df560102423a1d1c7c49e22d172549699b5010a8f2ef49a44cdb153b08b8237","observation_id":"c16415e0-110b-4953-8524-66b384c9247a","resolution":{"observed_at":"2026-05-12T07:11:24.384121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:d8b47b00b8938467685797cff0452ba86e5be0fdfd5cc11847a6178e18e107df","observation_id":"831c6896-fa2f-4a9c-89d4-62112c5abc83","resolution":{"observed_at":"2026-05-12T07:11:24.398856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on LLM-as-a-judge.The Innovation","venue":null,"work_id":"f3669316-0882-4835-abe0-4580d13dc8b3","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:7e5e5a9d05ab3e30cd287b2ae2da44ed2acbf593cf31b094cce626a4fdb9cd91","observation_id":"c0b57059-355f-42d3-afb8-5e498ca61b36","resolution":{"observed_at":"2026-05-12T18:41:47.687577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:c3ecbdf56e1d8572866b0bedbb2b805dc9e0cc1822b23f0cd0e218b39a27df5e","observation_id":"8d97dbb2-290a-45bd-ae91-22127eab1f0e","resolution":{"observed_at":"2026-05-12T07:11:24.407524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.627804Z","title":"Visplay: Self-evolving vision-language models from images","venue":null,"work_id":"283f2b88-cd61-482b-bd8c-64fd7bd57e60","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:6d2364241702c57bd21a450e650b97dfb9adc8edb0ff287b9d37257e1fbe26be","observation_id":"5f35d001-1f42-49c9-9a27-df899b525c8d","resolution":{"observed_at":"2026-05-12T07:11:24.411974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:55.374505Z","title":"Lora: Low-rank adaptation of large language models.Iclr, 1(2):3","venue":null,"work_id":"80a84b35-042e-4846-80ca-177dbf9b1b1b","year":2022},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:77deee2822586fbe4b6fb19e3335cce361578321ad62af558969a1eb471daf9b","observation_id":"7422b71b-1af5-43aa-8217-53cd58313dae","resolution":{"observed_at":"2026-05-12T18:41:47.684032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-10T18:17:33.697242Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a33195859fb040eb3db93f28498e26066733f8209eb01ee1eda40abfb8e4adc0","observation_id":"00663b6f-c180-4836-998f-9ced3017c357","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models can self-improve","venue":null,"work_id":"8c88c054-f436-4d51-87bd-800a86b6333f","year":2022},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:99d45aedf5816608ed8cdd4c34c2743bea316a18488212ea38aec953582754c4","observation_id":"b41f7614-9b3e-4d97-a544-1e7f5cd34ca3","resolution":{"observed_at":"2026-05-12T18:41:47.675439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03979","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.391833Z","title":"Likelihood- based reward designs for general llm reasoning","venue":null,"work_id":"0f0b3017-6fef-42b2-b7ba-6358bd0f635d","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:2db50ab0091b983ac705e4fb43ec2454d1a3ae40cc769a45d883b84159f95d14","observation_id":"57d026c8-67e1-4277-af20-7b32c25b4dfe","resolution":{"observed_at":"2026-05-12T07:11:24.504310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09206","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:17:48.643113Z","title":"Mm-zero: Self-evolving multi-model vision language models from zero data","venue":null,"work_id":"540c4250-dc96-4f89-b16b-bf665a968d22","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:1b2e661f8c01e8987b4450d977687a1c95633ce6b50a82fef431cf080a9ac2f3","observation_id":"28de626f-df92-4a20-975f-61ed2752f138","resolution":{"observed_at":"2026-05-12T07:11:24.486410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-07-06T21:39:52.201136Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:8b6ef346dbf5a86a7066c4bc42dd3aca178c8585e9a8ce59ed7b15d6611135c1","observation_id":"16caeec2-af6f-44dd-a223-a6cb3ee161ec","resolution":{"observed_at":"2026-05-12T07:11:24.431684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.14948","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to solve and verify: A self-play framework for code and test generation.arXiv preprint arXiv:2502.14948","venue":null,"work_id":"4eac7e71-856c-4c6f-97ef-54e10dfd93b1","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:edc03a522f82a710b76159f940d1466231d14569b6fd8940cafc8455ae3d54b5","observation_id":"0d67e572-25c0-4647-95ca-7e215ba60fe2","resolution":{"observed_at":"2026-05-12T07:11:24.473026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24684","doi":"10.48550/arxiv.2510.24684","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Spice: Self-play in corpus environments improves reasoning","venue":null,"work_id":"7bf84ba5-f40a-459f-b34c-8a73545856b4","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:03df093341293bc5e22382f2d554153c3ade0306c71bf012237feca43305f3ec","observation_id":"87a2e22c-a01c-4e04-affe-7eec69fa1f5e","resolution":{"observed_at":"2026-05-12T07:11:24.453062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmc: Advancing multimodal chart understanding with large-scale instruction tuning","venue":null,"work_id":"b4f7e089-3a70-4bce-ab44-0560ad551d7d","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:57e71318f61a5f55379f6b87724211ba0ab82ad829d7285ea8e0bc8536e6090a","observation_id":"1f0d9409-00c5-41f6-9c9b-641cfa2b5484","resolution":{"observed_at":"2026-05-12T18:41:47.666766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nover: Incentive training for language models via verifier-free reinforcement learning","venue":null,"work_id":"f3db13c9-292d-4144-b0ce-e383440bb589","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a5bd96a8c9d01ae1c278d333b37a420496ba17e81f4012590979d7f50b36ebde","observation_id":"fbe44300-a37b-428e-8437-8a4214bfca15","resolution":{"observed_at":"2026-05-12T18:41:47.670797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient paths and dense rewards: Probabilistic flow reasoning for large language models","venue":null,"work_id":"b6ab0099-bf3b-4397-bccb-75bf2407100b","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:6f9d287c77573e7248778a14f8b662f13ca8fe8e6a0428047aa7924955cb67f3","observation_id":"bf0ff9b5-e832-49a3-9024-be7fed9b2648","resolution":{"observed_at":"2026-05-12T07:11:24.511550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:40c427952d51568ba4111450d93a43f9a8e72bd92d03a4ccbeda24fc3ed5733c","observation_id":"83dfbca5-754e-4658-bc09-993207f89f4a","resolution":{"observed_at":"2026-05-12T07:11:24.553716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:50.108470Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"5d2e1082-e73f-4c1b-a18c-bf0ba1772c23","year":2023},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:e68dc915eb1e67a56a138484baa2c1d2b9f21799183ce258b7c59d4e6b08163f","observation_id":"8f05cf74-1770-4e58-ab9c-1663b97e08a5","resolution":{"observed_at":"2026-05-12T18:41:47.660181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:19:34.001123Z","title":"Can large reasoning models self-train?","venue":null,"work_id":"676b6b60-dcea-400f-9a21-469309587fd2","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:9074407c9108b06a6b87a6e1208eca6a393db85caf322dff6c79017b4c296f50","observation_id":"5514be62-3bec-4cb7-9ecf-8b7dc3c10321","resolution":{"observed_at":"2026-05-12T07:11:24.464065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:8deb270a448292b1f43ae2ba34c5080ed56c5ccffcd4925a769881d9449d0c55","observation_id":"27103efc-20fa-49ba-9545-5f22c98f9388","resolution":{"observed_at":"2026-05-12T07:11:24.437860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:55a22ac258a371c2913bb929b0d6b24f7ecc0f6ab9b2075c75330f470424591b","observation_id":"8ca4eef0-e1bd-4d8f-92e3-b750f6589665","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai models collapse when trained on recursively generated data.Nature, 631(8022): 755–759","venue":null,"work_id":"6ffb8914-c6bb-4027-a4ca-097de8c57320","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:0a513269b58fc506f9071d1460ac0ecef416d06e298676544a507fb366b97778","observation_id":"a998ee1d-6dcd-49e0-ada2-e292fee87927","resolution":{"observed_at":"2026-05-12T18:41:47.680122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models for data annotation and synthesis: A survey","venue":null,"work_id":"f2d19afc-161e-4e46-ad03-8aa6646b437c","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:ab2d1fa366da958670c10c90ec152fdb705bcc96f6b900f02a5d9fb2feccd28b","observation_id":"5a81e153-6fde-4b76-89e0-dd9a1e24c30f","resolution":{"observed_at":"2026-05-12T18:41:47.655845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.14387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-07-04T10:59:47.067283Z","title":"arXiv preprint arXiv:2404.14387 , year=","venue":null,"work_id":"ffd0559d-37d0-4858-8aaa-84dc7e4a3541","year":2024},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:f5afd875265795a92f292744cfbd0585eacd0f39eda0cca2cf48c9eb8e4ce646","observation_id":"73f7c354-7309-4110-bfb0-f21c8baf3e9d","resolution":{"observed_at":"2026-05-12T07:11:24.492516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"cited_work":{"arxiv_id":"2604.13602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13602","snapshot_observed_at":"2026-07-04T17:09:59.250632Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","venue":"cs.LG","work_id":"fc71ddff-02d7-422e-852d-f4874cb845b5","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2604.13602","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:bc4ec900b2cf94f6d6e5acd29e7713d6853191447f78ed8c8be43372558a132b","observation_id":"cc76e99e-c79d-4848-a707-cde085ffddd0","resolution":{"observed_at":"2026-05-12T07:11:24.516462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"8ea8bb68-cdf0-48e9-bb14-a12c9c3676c1","year":2022},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:c679da125d4e2b771b9c4b05744bdec9ae4b7b1e1dd0c43b8bf19baf0b8de5a4","observation_id":"8494457b-3874-4abb-8e43-6112c20455ef","resolution":{"observed_at":"2026-05-12T18:41:47.643799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:56:13.707156Z","title":"Associated with the WaltonFuture GeoQA-8K-direct-synthesizing dataset release","venue":null,"work_id":"0b4d9d50-bd06-4aac-8a6e-519967317bf2","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:e2cb82b16a5725f138c83c9def4d77b6d809259682d63984e944388fbc1f26f5","observation_id":"732e4e6d-91f2-4048-8869-e1e5ea745ace","resolution":{"observed_at":"2026-05-12T07:11:24.548729Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A systematic survey of self-evolving agents: From model-centric to environment-driven co-evolution","venue":null,"work_id":"b15d8067-0842-4384-9d82-82bcd5aabd27","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:be2bbe288291a8e6f97a2084fc88ac2e2e11e916982e65acbae28cfc89ea79de","observation_id":"b2592111-9a7d-4043-969d-5886727b9b42","resolution":{"observed_at":"2026-05-12T18:41:47.647847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with conditional expectation reward","venue":null,"work_id":"f4b7e593-3d22-4de4-962a-16e23950e9ea","year":2026},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:533f4ec2f51407a047384854e01f3a4fef4ab60869b2a79dc3c2db3bd77850d2","observation_id":"140089a8-92bd-4ec4-829c-5d4be0611c28","resolution":{"observed_at":"2026-05-12T07:11:24.534561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a91921d5148845c71549fbcec912f1d6b353b8093fcb06e06dcff69775ed20a7","observation_id":"ee43180b-99cc-437e-894f-55660022b433","resolution":{"observed_at":"2026-05-12T07:11:24.477601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on recent advances in LLM-based multi-turn dialogue systems.ACM Computing Surveys, 58(6):1–38","venue":null,"work_id":"94030dfe-833d-4102-9198-be560017ec75","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:37063bff23c4d76b28356ae5884bd49dfda7b98013bec08b37e7a4bede57d91c","observation_id":"287766b0-65f8-4c3b-9523-f4e7edd5de08","resolution":{"observed_at":"2026-05-12T18:41:47.651818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-07-06T21:46:02.163343Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:3e29c746fe5a5848c9675bd27aa0c09f1ccddcc6cf55e408319f9e02deb1ef5b","observation_id":"85edc4c9-1f3d-4cd6-af42-7efe2ab62f6f","resolution":{"observed_at":"2026-05-12T07:11:24.558508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:19:59.984011Z","title":"Guided self-evolving llms with minimal human supervision","venue":null,"work_id":"b3ab982e-f3fe-4249-88b3-341d8d0f3ff5","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:9836349b103f4d40c7d67aa2a074d838aa2b017fef38d5b75df7e3ffcb15f9af","observation_id":"23f2d637-7416-46f1-805d-7293ba346d2e","resolution":{"observed_at":"2026-05-12T07:11:24.457773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":"2505.03335","doi":"10.48550/arxiv.2505.03335","metadata_source":"pith","pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-10T18:17:33.800267Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","venue":"cs.LG","work_id":"b59092c4-76ed-4c78-9006-312bde2e40a6","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:c2aeb40e420995dd26472d53391615cb48e99404509353bb6e7a139cb970f2c3","observation_id":"cbea89e8-be55-4407-a99a-d11bd8775cdb","resolution":{"observed_at":"2026-05-13T18:23:09.397455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:2c8d710f8505462d2ba78ea54e545a4e4b717ce781504744c7943b76e9ca48ee","observation_id":"4b644172-508e-49e9-a4a0-88c20667348c","resolution":{"observed_at":"2026-05-12T07:11:24.444360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:244af752f064b7febf29c047479384c1a61aa380ea0aa1e244c789dd5dacda0a","observation_id":"e01d6ce9-375f-44d7-b0c2-6248af681050","resolution":{"observed_at":"2026-05-12T07:11:24.522825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-07-06T21:35:03.439393Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"cited_work":{"arxiv_id":"2506.01716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01716","snapshot_observed_at":"2026-07-04T20:40:08.275113Z","title":"arXiv:2506.01716 [cs] doi:10","venue":null,"work_id":"f17aef0d-21ef-4877-b0a2-e7492e1d481f","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2506.01716","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:484cb6daa0d8aa8f8aa4df0e08365ebba9d709bc5420200d2223c3e5819753bf","observation_id":"d6a93fdf-ad16-42ef-be51-5363fbcb7baa","resolution":{"observed_at":"2026-05-12T07:11:24.540151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":28,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2605.09959."}