{"as_of":"2026-08-12T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a7dfcfb5c5a473fe4dbfcf5cb83cfc6550435419185de374f5e74c11e58c118","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:53:08.348473Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T16:53:00.860162Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T20:16:08.415773Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"cited_work":{"arxiv_id":"2510.18814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","venue":"cs.LG","work_id":"bbdbc74a-b994-40d4-bba2-fe6e7c46099f","year":2025},"citing_paper":{"arxiv_id":"2605.04542","last_updated":"2026-05-06T06:42:47Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:42:47Z","title":"Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-05-08T16:53:00.860162Z"},"links":{"cited_paper":"/paper/2510.18814","citing_paper":"/paper/2605.04542"},"observation_digest":"sha256:ff748b17b7b0a912cdade478fc102de6b5e03731fec60fcd5a63833be68ed4af","observation_id":"85b1f823-e10a-4142-a696-91ed2d311549","resolution":{"observed_at":"2026-05-11T17:56:08.204338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"cited_work":{"arxiv_id":"2510.18814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","venue":"cs.LG","work_id":"bbdbc74a-b994-40d4-bba2-fe6e7c46099f","year":2025},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-08-10T23:06:59.515096Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2510.18814","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:5ec00785326418653cd7e954c7ebcc6c2ef9fea63481a6fd06f94bbcf85542c9","observation_id":"879b653f-a7ec-4d1d-96a0-6cccdbc684cc","resolution":{"observed_at":"2026-05-11T20:16:08.418279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.18814/citation-record","integrity":"/paper/2510.18814/integrity","json":"/paper/2510.18814/citation-record.json","paper":"/paper/2510.18814"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T08:53:05.173699Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.173699Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:cd6488f2687e4511e7e581b9a4c59c37cec6634b0e0c42a934b34a3aec71f1a9","observation_id":"cf39d836-2137-4f3b-84d0-0e6d6bf2a823","resolution":{"observed_at":"2026-08-04T08:53:05.173699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-11T01:19:00.494448Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-04T08:53:05.547904Z","title":"Reasoning models don’t always say what they think.arXiv preprint arXiv:2505.05410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.547904Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:7e7266b20d13c434d2169ee9cf84643cb70d5668c0955d5588a7a143a0710b55","observation_id":"b4076495-9561-4ac2-a970-59b3cd42d405","resolution":{"observed_at":"2026-08-04T08:53:05.547904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-04T08:53:05.655329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.655329Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:ae2d60f67e9159971137f5ff5ed80258f4425286fd617fdb049c34e2bd3b2d64","observation_id":"c6342b43-de70-4242-ba2b-59ae70103976","resolution":{"observed_at":"2026-08-04T08:53:05.655329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T08:53:05.768844Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.768844Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:737b50f39f12e7fab072f64d6fc5ae17ffb3581b78ff0b05e09be75e10664032","observation_id":"da3e1e1d-bd81-450f-82b4-e482f3bb5800","resolution":{"observed_at":"2026-08-04T08:53:05.768844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-09T02:57:31.005115Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-04T08:53:05.911880Z","title":"Etash Guha, Ryan Marten, Sedrick Keh, Negin Raoof, Georgios Smyrnis, Hritik Bansal, Marianna Nezhurina, Jean Mercat, Trung Vu, Zayne Sprague, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.911880Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:20e268f8bab4f13ba5327df819294f72780d71b9abcdf972805b51e2406af976","observation_id":"491c0c6c-141d-4f76-8c3e-12a663d4e1fe","resolution":{"observed_at":"2026-08-04T08:53:05.911880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-04T08:53:06.053247Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual mul- timodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.053247Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:2a2f3b949927d1f7a8a8f7b8eccb04b47f58cc894f355fa05de2e5d028483985","observation_id":"98dabe1f-2958-439c-8e28-0816f7a67f9d","resolution":{"observed_at":"2026-08-04T08:53:06.053247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:53:08.348473Z","title":"GRPO) is similar under our experimental conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:08.348473Z"},"links":{"citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:c4325eea9c1a00592fc97cca3e35b82f1a4c382a5cfd64e82aa5d256b2c77c74","observation_id":"b7b4f8c6-1178-4203-9f0b-22206d04bf26","resolution":{"observed_at":"2026-08-04T08:53:08.348473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-04T08:53:06.544194Z","title":"Zichen Liu, Changyu Chen, Wenjun Li, Penghui Qi, Tianyu Pang, Chao Du, Wee Sun Lee, and Min Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.544194Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:3fab47e81a5e0fce1182a976e280f9d39a85fa2e393d79133810d4181916c3a4","observation_id":"9243bc89-0d0c-449c-99c0-035e7851e51f","resolution":{"observed_at":"2026-08-04T08:53:06.544194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-04T08:53:06.710900Z","title":"Notion Blog","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.710900Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:e5cf089c97c4662708a8880261d426f60c17d498260f6233b1d3e6c427760a04","observation_id":"27ceed12-5a91-4ccc-9808-3734ef39a896","resolution":{"observed_at":"2026-08-04T08:53:06.710900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:53:06.881699Z","title":"Accessed: 2025-01-24","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.881699Z"},"links":{"citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:c3d4319155f98dab7fc3124a9d1402bbf2e7367e68f62824abe0aa6abeb7d16d","observation_id":"1ccc0185-6031-48d4-ad19-5cd3fa13cedf","resolution":{"observed_at":"2026-08-04T08:53:06.881699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:53:07.031456Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.031456Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:27bbb91b8ffb98b4c8cfd3791a6f0f6300c2b87dd0b8379424465475ba9d95ee","observation_id":"a4ee002c-3ebc-47a7-a92a-24d383a522f7","resolution":{"observed_at":"2026-08-04T08:53:07.031456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T08:53:07.327544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.327544Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:08ad2ef6d7b78f7c3c98e22485d67be8a9d717541a46247a4965adbc26515d19","observation_id":"ae146751-903f-4e7d-9bc4-c3984c324908","resolution":{"observed_at":"2026-08-04T08:53:07.327544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-08-09T21:19:24.140229Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06941","snapshot_observed_at":"2026-08-04T08:53:07.434034Z","title":"The illusion of thinking: Understanding the strengths and limitations of reasoning models via the lens of problem complexity.arXiv preprint arXiv:2506.06941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.434034Z"},"links":{"cited_paper":"/paper/2506.06941","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:351a60b62c26d8760dbe2c81c319363b396f0124c997ce471451590217b2d19d","observation_id":"5ec71e96-83f3-4424-80e2-8c52bf4bf450","resolution":{"observed_at":"2026-08-04T08:53:07.434034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-04T08:53:07.536180Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.536180Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:cbf9746ab453968c586c751375ec53051b2d416313c014127856454c86511ed7","observation_id":"9041d8d7-48e6-45f5-ab80-a72bc9f0c30a","resolution":{"observed_at":"2026-08-04T08:53:07.536180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-04T08:53:07.648043Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.648043Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:48b40f264351360c1c27a53f1191a34a322b3f3aeaa268cd0dc3958e2d4e5650","observation_id":"c4c81fab-bc18-4eac-aacc-45484db3baf2","resolution":{"observed_at":"2026-08-04T08:53:07.648043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-04T08:53:07.747822Z","title":"Light-R1: Curriculum sft, dpo and rl for long cot from scratch and beyond.arXiv preprint arXiv:2503.10460,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.747822Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:62fda5dda59f871d4c977b332c0b06f815458e0cde6655f0b5ab5497d6ff15de","observation_id":"a4abdab7-eff5-47e4-8935-3ee46b435881","resolution":{"observed_at":"2026-08-04T08:53:07.747822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T08:53:07.799133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.799133Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:957549f6c5d2fe7429c4b76010c0fdd3e248c7148fd11b9ace82d2b81901e684","observation_id":"f83abaae-1da9-4cdc-a873-9fb1f7b67d01","resolution":{"observed_at":"2026-08-04T08:53:07.799133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-04T08:53:07.877463Z","title":"Yixin Ye, Zhen Huang, Yang Xiao, Ethan Chern, Shijie Xia, and Pengfei Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.877463Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:b7761234fc00795cda5e9c74122df0eb0e5e80f4e0447a6351dd4c39901b6a43","observation_id":"3b5f9f11-bbfc-48ce-bc9e-fd9644904b20","resolution":{"observed_at":"2026-08-04T08:53:07.877463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T08:53:07.926195Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.926195Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:33e4aac55d502fcd1f3c5c60a7379f8d0047f96f4992d3dd00ba23e4bfcd2cb2","observation_id":"5c946287-8095-42a9-8015-c6cf3e942dce","resolution":{"observed_at":"2026-08-04T08:53:07.926195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-04T08:53:07.999980Z","title":"Does re- inforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.999980Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:6dbe82e4ef9c6c8f0167b0f7306b178ef8c1101a27fe89069f5027e03542308f","observation_id":"ff0600e3-ab3d-47dd-90b6-b523632f6565","resolution":{"observed_at":"2026-08-04T08:53:07.999980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-04T08:53:08.054190Z","title":"Simplerl- zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:08.054190Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:af9d903f7255ea2f29b97274862533024ebe62917c3f8bd4fc20113e73e71e48","observation_id":"a1cc2718-4317-4daa-aa01-d73bc473d594","resolution":{"observed_at":"2026-08-04T08:53:08.054190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-04T08:53:08.129407Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:08.129407Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:c808d2a4f113fd914ee6cb9be3b09352e56b15a722938d5d2ae5d63c6855741a","observation_id":"44cfdba6-2e01-470f-bbd1-8d739dea1c34","resolution":{"observed_at":"2026-08-04T08:53:08.129407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:53:08.208235Z","title":"CONTENTS 1 Introduction 1 2 Preliminaries 3 2.1 Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:08.208235Z"},"links":{"citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:6b72bde93a46a74b5e08dd453909ef845051f901e5a733aef57321773a11948a","observation_id":"8f3f9da3-053c-43dd-a9cb-1d46c9d7af85","resolution":{"observed_at":"2026-08-04T08:53:08.208235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:53:08.264018Z","title":"We also provide ablation study forτ eval in Section 4.3.3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:08.264018Z"},"links":{"citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:c938eb22dc3b1dd6f980cf4981857aa57e5f02bbf4c73eb57fc78eca494c3912","observation_id":"c3c5c9e1-aa6e-4f4b-81d0-08eee520b591","resolution":{"observed_at":"2026-08-04T08:53:08.264018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-10T11:02:14.031196Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T08:53:07.162212Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.162212Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:97f343c2eda7ef6d24322ea454d522a21eb704362ecf1f34f0b83fb3ce315aad","observation_id":"1d569e59-5604-43f3-ab7f-8d9ffc7f311f","resolution":{"observed_at":"2026-08-04T08:53:07.162212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-04T08:53:06.305427Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.305427Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:137d41f0b3721914f3437d3491e0e2b494f881ff43e4d28284585c4e66addb05","observation_id":"c857a778-3de6-4291-857f-798d494a7e6c","resolution":{"observed_at":"2026-08-04T08:53:06.305427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-09T18:38:39.510086Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-04T08:53:06.449889Z","title":"Llms can easily learn to reason from demon- strations structure, not content, is what matters!arXiv preprint arXiv:2502.07374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.449889Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:1018c76a94eff9cbaadff79e225f88061a27794eb43f2a87f55728632613b598","observation_id":"836a0a5e-7ca5-4377-ac97-b2b72f0e58b8","resolution":{"observed_at":"2026-08-04T08:53:06.449889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-04T08:53:05.285310Z","title":"The unreasonable effec- tiveness of entropy minimization in llm reasoning.arXiv preprint arXiv:2505.15134,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.285310Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:adc2eb9d3816d556937fa54f9e3dadd9e9425a80e0bcb9aa9d512ef33221e853","observation_id":"d2895232-604d-418b-ba1e-5dcc43126f89","resolution":{"observed_at":"2026-08-04T08:53:05.285310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T08:53:06.195668Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:06.195668Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:761abbe27ed82c3c59fdeae43b4e97d53cc92fd1bda1349896301e11adcfadac","observation_id":"fde9b704-daeb-40ec-8a0e-f1086bca7d6d","resolution":{"observed_at":"2026-08-04T08:53:06.195668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-04T08:53:05.427930Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4.arXiv preprint arXiv:2303.12712,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:05.427930Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:fbf66e42295667088348cf1c9db3c2e473f02460e9bde8f19d9ece147a9e7ecb","observation_id":"076618a5-094f-4da6-80c7-4231b5d28439","resolution":{"observed_at":"2026-08-04T08:53:05.427930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2510.18814."}