{"as_of":"2026-08-08T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0dbd6167598cc66e61ae37dca8862181e1fabe2087336721de5ae94609d468f","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:35:56.253150Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:22.158083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.505929Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:f146702cde53425c27efd4e5f6e4fdbbbfbfb9f621439057ca9cd70320fc16f6","observation_id":"5011bd04-bd69-40bb-b9b5-63b1463ceb1d","resolution":{"observed_at":"2026-05-22T21:42:10.812398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-07T05:26:22.158083Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-07T21:57:29.256197Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.158083Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:4f5bc93fc9f969ec97eb39b06eb273851c96ef631791d8f16f4c3de2bee7387b","observation_id":"881d37f7-a003-4bc1-a8de-289095639b6c","resolution":{"observed_at":"2026-08-07T05:26:22.158083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:91439f63f2750703f33989e1d46fde6d9bfd7a0166a6b580e91edb989b00b8bd","observation_id":"09f1d75b-3d1f-411a-81d3-dc06e696881d","resolution":{"observed_at":"2026-05-19T09:52:14.184491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-06T14:51:25.447032Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-07T21:58:59.979090Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.447032Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:c60b98075b8cfa10806e1bedc1646b036b4d3757103602add4c326ee72aabacd","observation_id":"d9cb06d2-5012-4061-985a-434b37d473ca","resolution":{"observed_at":"2026-08-06T14:51:25.447032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-05T00:06:08.567934Z","title":"Reinforcing general reasoning without verifiers.arXiv preprint arXiv:2505.21493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06160","last_updated":"2025-09-07T18:07:58Z","snapshot_observed_at":"2026-08-08T05:58:57.881178Z","submitted_at":"2025-09-07T18:07:58Z","title":"Reverse-Engineered Reasoning for Open-Ended Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:06:08.567934Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.06160"},"observation_digest":"sha256:7cb660ac7fa7737c980d461029ef65039cb3d1b76363cd5839dd6976b281410d","observation_id":"85b3a33d-241e-4e2f-ab1e-ef958c464377","resolution":{"observed_at":"2026-08-05T00:06:08.567934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:a29731ad6872ecd970a76dfc35beab3d05021f39d711ec87364ba7316adf7fee","observation_id":"f8b2fe70-730b-4ddc-8020-c762a6a2adf3","resolution":{"observed_at":"2026-05-18T15:46:34.124175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-04T16:07:48.740176Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:48.740176Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:3ef9c9c5c475d33cef7fbc64355230868cd0af9d92321a6a6c68c855d63f5f20","observation_id":"adc3cf64-8802-4479-ba29-f2d3a969ed65","resolution":{"observed_at":"2026-08-04T16:07:48.740176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2511.09907","last_updated":"2026-05-08T08:34:38Z","snapshot_observed_at":"2026-07-06T22:35:41.533403Z","submitted_at":"2025-11-13T03:08:51Z","title":"Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T22:59:48.260121Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2511.09907"},"observation_digest":"sha256:eea6a828100784064eaba130cb1168bd4d487ba6a3320afa3cbd0ee56458247a","observation_id":"57b2310b-f1db-4c8c-8d96-305438cda973","resolution":{"observed_at":"2026-05-17T23:00:25.487127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:1d805a5b1d392dab9886cb9a5cb43da763404bc21244a5639f901f2145c5fb69","observation_id":"b607286b-d83d-43df-9474-bd80a6ef4580","resolution":{"observed_at":"2026-05-25T07:26:41.714012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-07T12:08:03.856446Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:7b25a0deeecb15a513813206240c85acc4348f5bda48a78b55527ef81e4aec65","observation_id":"52f3cb1b-099f-4c53-9e14-867cb07c84b5","resolution":{"observed_at":"2026-05-10T05:36:02.036290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:f3269f25ff1514390ce91c03550b4449cb31ccadd72c42668cf861e05508fbc7","observation_id":"9c6b2e4e-3b78-4ece-bb46-3f61bff623b2","resolution":{"observed_at":"2026-05-10T23:15:49.560996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-06T14:18:13.260138Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:2d639f73136c7f5a41824c437e271a8bdaf561b8a36d84cd3938ac975bc952d5","observation_id":"e01d6ce9-375f-44d7-b0c2-6248af681050","resolution":{"observed_at":"2026-05-12T07:11:24.522825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-01T14:39:13.243144Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:25387a911210a0cc8570e1b68b393135e4db8c10ad4e9dd358b7348358115545","observation_id":"8727f605-db0e-467b-8e17-1e63a94ffd2b","resolution":{"observed_at":"2026-05-19T17:22:41.894869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-05T16:11:23.807977Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:41c1d19bdb4fea3ccd835f6c828cf96fdfbd984a8a8c8a40764b724b403fafdd","observation_id":"a24852dd-a7ee-4c3c-9469-f35df85cafb7","resolution":{"observed_at":"2026-06-28T19:02:33.978221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:665a37bd961b967d1abd9ac3cbf6d18e2bc841c1a1dd3ff203f18777271071f6","observation_id":"d86298e8-0466-4040-9e5a-1d394911d33f","resolution":{"observed_at":"2026-07-01T20:56:13.507223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Reinforcing general reasoning without verifiers.arXiv preprint arXiv:2505.21493, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:488df3dfec0f4c9683d06c67f418ced5774f6db53c0231d982f84d934fc8ed10","observation_id":"1c040be7-4644-4a71-ad7a-08c77ae88e6e","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21493/citation-record","integrity":"/paper/2505.21493/integrity","json":"/paper/2505.21493/citation-record.json","paper":"/paper/2505.21493"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T13:35:49.676520Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.676520Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:cdc230d0c0177b39d529b3dd6d1240868dc488dea6388c5a45e9220d3c72ebf3","observation_id":"a93d6290-e684-40aa-84ad-0648f6d7895e","resolution":{"observed_at":"2026-08-07T13:35:49.676520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.693470Z","title":null,"venue":null,"work_id":"8ed9980d-ca48-41d0-b56b-1deb6284bd9c","year":1996},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.783935Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:25407c56e7f4425e8a8583445dad6e1df696cc7f1ed4bb3529960caede8f5e3d","observation_id":"6b8912b9-44d6-4993-8c75-365c99efb6f4","resolution":{"observed_at":"2026-08-07T13:36:00.810288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.477862Z","title":"Bootstrapping language models with dpo implicit rewards","venue":null,"work_id":"28fc5ce4-1882-41c1-bbcc-49a0513cb09f","year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.895146Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:741c9da86a769ff04ffdeafae43905f093182dd8b863f973af69b29dcd47237a","observation_id":"da40036f-4d63-460f-9951-a80959496b15","resolution":{"observed_at":"2026-08-07T13:36:00.555733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-07-06T19:46:24.121362Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-07T13:35:50.020849Z","title":"Language models are hidden reasoners: Unlocking latent reasoning capabilities via self-rewarding.arXiv preprint arXiv:2411.04282, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.020849Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:b67a4e063c9e2242656d46ffb74fcf6396f9cb37d1623b3b91c01b504f13f5c4","observation_id":"52ebb6e6-cb33-47bf-9fd6-91affe7684c7","resolution":{"observed_at":"2026-08-07T13:35:50.020849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:35:50.157115Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.157115Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6c967afbe4bc25463aa03117ef662d7b3c8b390b1eef039cc0ab3dd04c42326a","observation_id":"81e3becc-9596-4c67-8111-196dba531996","resolution":{"observed_at":"2026-08-07T13:35:50.157115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T13:35:50.307619Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.307619Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:0b67cc7ed407911b2ddce4e77d25cae8ba14d8740ec43e0a0930dd8f17b92f32","observation_id":"2d669c5b-0d3a-4ba5-9a8e-f0cf67637d61","resolution":{"observed_at":"2026-08-07T13:35:50.307619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:50.451904Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.451904Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6019fe2a0aa5001c5afc85c3bac42ec0131d0de1b76f08a18745ff25da14c82d","observation_id":"7a802705-31d5-4dfe-9f52-c59d5cddffa1","resolution":{"observed_at":"2026-08-07T13:35:50.451904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:35:50.613928Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.613928Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a10937519ccab7d34716bad6bf4ce8f8abff2bb71827685adb1b023ab5998aa1","observation_id":"41cd47ac-0822-4c76-8982-68592cfe2bbc","resolution":{"observed_at":"2026-08-07T13:35:50.613928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:35:50.694745Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.694745Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:02337f7ad69ef5c64ae999a353cfc108fad4e5ee0d4ba646fc106a1645df0f68","observation_id":"5dade0db-61c1-4c40-8094-7951010b67e5","resolution":{"observed_at":"2026-08-07T13:35:50.694745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:35:50.841396Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.841396Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:ece9460c529a16af247a226f63b39c8b89bf05aeaa4338cadf6ebd5a36308103","observation_id":"f51e8249-efdf-4f50-a80c-83e7ace68b80","resolution":{"observed_at":"2026-08-07T13:35:50.841396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:50.986072Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.986072Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6c44d237158e16cfff0ad3393d7d210ff59516b26e69089a216a1f3b4d1d7e70","observation_id":"532f803e-3d01-46a4-aeea-6d6fa3efeaf9","resolution":{"observed_at":"2026-08-07T13:35:50.986072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:35:51.098076Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.098076Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:60266b8bcc274e983c8961095ac580e8879c325f805263fba91dc77a3ed2266f","observation_id":"8ab29f53-b30b-494d-88ee-a43a1f872e9f","resolution":{"observed_at":"2026-08-07T13:35:51.098076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.205483Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.205483Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:8b1c69ca3493f68c18d60630c2ebc7d2f5d6b2313c31fd394a5c9ccc8edf7a93","observation_id":"3317d73c-bec0-4a93-9f00-2ebfaa75998e","resolution":{"observed_at":"2026-08-07T13:35:51.205483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T13:35:51.324740Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.324740Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:650ec66a07c97241d14693a1cfaf33bec0b40b37c35a3796c03d04e5b872fe38","observation_id":"b2bbc0d8-6d7c-4e9a-8559-ef1948d36c91","resolution":{"observed_at":"2026-08-07T13:35:51.324740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-06T10:12:18.959183Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T13:35:51.425938Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.425938Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:74603cd4bc802745c286124b2238ea7be5f1e60be07abd7b3fa89b70b7dbeaba","observation_id":"b479d45d-7c4b-4ae8-800e-17e7f52fb058","resolution":{"observed_at":"2026-08-07T13:35:51.425938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.526601Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.526601Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:45c31aadf7347c15a7b0cfcb51c30b3b3e5dd57e643c5c5bc6ff5196659387cb","observation_id":"81cf8b30-cfc3-4b32-a192-89c7731e1297","resolution":{"observed_at":"2026-08-07T13:35:51.526601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T13:35:51.600499Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.600499Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d39f4b3d61448e1ec001c3d687ec0ad1ca2be82b2a3b55eb0df77e3fe10fd524","observation_id":"7d2439f9-9c29-4fb7-b7ca-c8cb2be5b697","resolution":{"observed_at":"2026-08-07T13:35:51.600499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.708819Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35:3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.708819Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:10740b304c808b7ed61b2d66f1239f3f11c728a04f82ebe972929990d97aa1bd","observation_id":"59922537-1b14-47ce-a2d4-346a1010e5b7","resolution":{"observed_at":"2026-08-07T13:35:51.708819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.819498Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13:9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.819498Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:84e454a44942c02d15b010501eec8ebce04b1ebdcbd3572db619dfbb4e5d6d1e","observation_id":"cadd1958-83e1-4260-a2fe-7ebce56bb0ee","resolution":{"observed_at":"2026-08-07T13:35:51.819498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.952732Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.952732Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:54a2e7137135ac658486d6f19057307ce57966c4089f7ac2b80956a80fd55157","observation_id":"fb322e58-6b54-4677-94c9-26d5f8f67426","resolution":{"observed_at":"2026-08-07T13:35:51.952732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03981","last_updated":"2025-05-06T21:08:27Z","snapshot_observed_at":"2026-08-07T15:49:23.234741Z","submitted_at":"2025-05-06T21:08:27Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03981","snapshot_observed_at":"2026-08-07T13:35:52.104790Z","title":"X-reasoner: Towards generalizable reasoning across modalities and domains, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.104790Z"},"links":{"cited_paper":"/paper/2505.03981","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:42c458e71b5a70627709c8f8f785b86480ecb40770108b94ad1dce2c8d0c07b6","observation_id":"23d49f70-44e6-486d-8234-6972ef41ec39","resolution":{"observed_at":"2026-08-07T13:35:52.104790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.144588Z","title":"Oat: A research-friendly framework for llm online alignment.https://github.com/sail-sg/oat, 2024","venue":null,"work_id":"21dfbb55-c73f-4bdf-bb7f-7e38618b25f1","year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.211512Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:648b92b7e20f287f1b2fedbb82e0a74b9258dd6a0813050556fe42fd143a47c2","observation_id":"8f616da6-ee5f-48fa-a183-eb4a4e5ecd88","resolution":{"observed_at":"2026-08-07T13:36:00.206502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.284816Z","title":"There may not be aha moment in r1-zero-like training — a pilot study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.284816Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:5db344fa6df33ef288d319fc94b4f6d5c0890f1e0b582d1cacbbeeb26a0d46be","observation_id":"99224617-7326-4c1a-85f0-2dd010ea96bc","resolution":{"observed_at":"2026-08-07T13:35:52.284816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T13:35:52.414743Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.414743Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:37eb0802f4d2f2900ecec4fee6d36c3f3c88d15e1a97df6fe7ce729f57bd872a","observation_id":"8fd9a995-3dc6-479b-9102-e66be0b39631","resolution":{"observed_at":"2026-08-07T13:35:52.414743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.527377Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.527377Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:1c5f1ac2e257c7678f8a8fa5dbd0a09951e4750f2019f5277c9a0df6d527da47","observation_id":"00842862-6da4-4cb5-947f-450fb3d521b8","resolution":{"observed_at":"2026-08-07T13:35:52.527377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.600474Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.600474Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:11d4a4c10d65d2762c15a077302884549056b45e27b26bf5d8d7b39c4fe0688b","observation_id":"f99e1cdc-3791-47c3-88d4-7fe27993c55d","resolution":{"observed_at":"2026-08-07T13:35:52.600474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-08T07:13:10.579807Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14652","snapshot_observed_at":"2026-08-07T13:35:52.681204Z","title":"General- reasoner: Advancing llm reasoning across all domains.arXiv preprint arXiv:2505.14652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.681204Z"},"links":{"cited_paper":"/paper/2505.14652","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:02c8484c4abd0a1d5cca925a244f9dd3d309836f1931f44e690eaa57a68ab608","observation_id":"e8604899-443b-4c3e-8189-b8cef03b172b","resolution":{"observed_at":"2026-08-07T13:35:52.681204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.885512Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":"8d6e3c4b-b3cc-4002-9ac0-0c0004ac577e","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.844277Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:bcfb5c4995c6b4880708b2f0374b7494fcd6a145a514502d35c633e41e08fe12","observation_id":"a64d249a-1c61-4104-b764-d954622e262e","resolution":{"observed_at":"2026-08-07T13:35:59.955749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.339055Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":"070a88e1-68d2-43ad-a75f-19ff043d325f","year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.099446Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:34e7f8faf01f3eb2590d092bfd2c20e9138b0b3559391626c4715b3e1c797207","observation_id":"4a747535-adc6-4e76-9340-bbe4f3af9954","resolution":{"observed_at":"2026-08-07T13:35:59.437638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.235958Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.235958Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:bb4a7a4e38f6e0d93da9f89ecbaaef890aa8c864df26e91d3fae4eeea1ef0ef4","observation_id":"fedd8f05-30b9-4aac-8644-585576047986","resolution":{"observed_at":"2026-08-07T13:35:53.235958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.355905Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.355905Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:5f6a6870675c621e338aea03712a34ab7ec2bad83bcad5c478458628ffac2cd3","observation_id":"6de7d42f-7f10-4ba6-967c-3f7b9cc6ec85","resolution":{"observed_at":"2026-08-07T13:35:53.355905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.112592Z","title":"Training chain-of- thought via latent-variable inference.Advances in Neural Information Processing Systems, 36: 72819–72841, 2023","venue":null,"work_id":"41c4afaf-ed7d-4d5d-923e-3e05048f0e9f","year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.438954Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:214c440e148e19df121c7b98dad77f40a4dd16b853aa8b392d8a7977e0bc2da5","observation_id":"a8008712-a0b1-452c-a993-0fa78b48d8e1","resolution":{"observed_at":"2026-08-07T13:35:59.181728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.528942Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.528942Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f54bebe4ebde6562e83abd702bf853fe48557116e014b116fc3b42a5c99dd781","observation_id":"80afe6a7-a471-41af-9798-d8c60a771a76","resolution":{"observed_at":"2026-08-07T13:35:53.528942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.876116Z","title":"Learning to drive a bicycle using reinforcement learning and shaping","venue":null,"work_id":"966de1a7-fe9b-4a20-8405-7a1018c8a324","year":1998},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.652657Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f8bc001f32ba6a5effa33ebf62c8b5afbd359a873308a0c1e9a7970f6c931643","observation_id":"a1dd8e9e-70b0-4602-9844-d1cab760b508","resolution":{"observed_at":"2026-08-07T13:35:58.957200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.729825Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.729825Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:731e9c0db9673341b930baef865f74b55d55e9a409442e7a1f42373b055b73ce","observation_id":"bff29ac9-4452-474e-a5a8-662cfbb18d31","resolution":{"observed_at":"2026-08-07T13:35:53.729825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:35:53.862659Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.862659Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:2882eccc96fa9422adeaed40b87feaa3a3e980ef491f57b7fdc306dc5b8b8bb7","observation_id":"ca43c1f2-a018-4109-b4ff-3389791b2fca","resolution":{"observed_at":"2026-08-07T13:35:53.862659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:35:53.962521Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.962521Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:bf83fb24a8a33c3a7ae199bec19becd80c6bd0d0ece9b2740c6b92b4ae0ebd03","observation_id":"a7849d0c-5308-4572-aae7-00b1eb99e966","resolution":{"observed_at":"2026-08-07T13:35:53.962521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-07T21:53:39.516862Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T13:35:54.067551Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.067551Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:dc101ad30baf714ca8abbf115acacd421af6a7e26fb7486a2cc4d3c0a8c6e9d3","observation_id":"facf22d4-454e-4613-b858-c10da0a74038","resolution":{"observed_at":"2026-08-07T13:35:54.067551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.172581Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.172581Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9ef2c9410dd59f1c7dcd591f5bd3988fca75ecab51b99061df6aae8d0f18455c","observation_id":"13680724-420a-4471-9655-96475f45143a","resolution":{"observed_at":"2026-08-07T13:35:54.172581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19618","last_updated":"2025-05-28T14:42:09Z","snapshot_observed_at":"2026-08-07T16:38:29.183974Z","submitted_at":"2025-03-25T13:03:09Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19618","snapshot_observed_at":"2026-08-07T13:35:54.275667Z","title":"Learning to chain-of-thought with jensen’s evidence lower bound.arXiv preprint arXiv:2503.19618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.275667Z"},"links":{"cited_paper":"/paper/2503.19618","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:07cb2fea3e9d17a69ef3e3f3320c2395f7d0da8863e8c95de07ff207b59b6582","observation_id":"c5e30f52-8d0b-4008-a8f2-fc41b25e47ad","resolution":{"observed_at":"2026-08-07T13:35:54.275667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.354782Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.354782Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:3cf9f7f8536a1256bf3a12edc0d0399105b97291c70ca0fdb19f9a64c1785738","observation_id":"23fbb93f-8030-4c13-9649-781b8f2dca25","resolution":{"observed_at":"2026-08-07T13:35:54.354782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.447387Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.447387Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:7755062b7a44916130f389577ffa868df0c05985ea20ce4a5858ef5d6c4ce636","observation_id":"a661f906-bd43-41e7-96cd-89f67894319d","resolution":{"observed_at":"2026-08-07T13:35:54.447387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:35:54.550113Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.550113Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:587b0f5b5512e5ead76e4af3b14f8d6b8372503c1068c09bbd93aa43949c36c1","observation_id":"8ae8c311-f20e-43d8-ad0d-9983c0c8b323","resolution":{"observed_at":"2026-08-07T13:35:54.550113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T13:35:54.659939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.659939Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:0ce26f117b4b240a26b2d0ca65354f8a89d05d1cbb5c342d7c7919303b96bec7","observation_id":"6ab5a380-d554-4d25-a2ea-5ba8c30cf2dd","resolution":{"observed_at":"2026-08-07T13:35:54.659939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:35:54.837737Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.837737Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e3cc61de2d98c0f49a7a47e45a6fcea0029f1cdd98260851790fcb772ab8967c","observation_id":"dfbbdad7-3e5b-4f76-a2f8-96a7f26b2e10","resolution":{"observed_at":"2026-08-07T13:35:54.837737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.656544Z","title":"Self-rewarding language models.International Conference on Machine Learning,","venue":null,"work_id":"ca1f10af-42bf-47fa-810c-647fa0b82a95","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.952680Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f49d58f69863cfa0ec7def3af86d731af6282261494c47059b83420b0a6ca041","observation_id":"0b46341a-8a36-4346-a992-69c3bac38ab0","resolution":{"observed_at":"2026-08-07T13:35:58.735265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.134741Z","title":"Naturalreasoning: Reasoning in the wild with 2.8 m challenging questions.arXiv preprint arXiv:2502.13124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.134741Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f93227bf4e130331f4e141d445dba352d11c38df5cc38fdd39c2329a1208990a","observation_id":"ea9dad09-2bb7-4512-9ae8-730ae885cb81","resolution":{"observed_at":"2026-08-07T13:35:55.134741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T13:35:55.254650Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.254650Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:11c7998ea13402b400da1ff9d8a40829ffa6779f896c801a1538b9eb752ad4df","observation_id":"eb9e4194-f947-421d-8802-662ec50072e4","resolution":{"observed_at":"2026-08-07T13:35:55.254650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.410399Z","title":"Mammoth2: Scaling instructions from the web.Advances in Neural Information Processing Systems, 37:90629–90660, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.410399Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:bbba4a3d666c5848c11c1978bb28c148b8267a8f1acf39c61b76baf3414b6e0d","observation_id":"9cb71e8a-757a-459b-a8f0-6bced49c0046","resolution":{"observed_at":"2026-08-07T13:35:55.410399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.558772Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient.https://hkust-nlp.notion.site/simplerl-reason, 2025","venue":null,"work_id":"316ff338-f6f0-4699-848d-790ae87ae2b5","year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.503236Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:fe7bfe222339d8f186614dccf3d7fa1a16a54d91218dbe71162753adcf322fa7","observation_id":"fd3fc11e-4ffb-4e99-b255-fabad4fbd632","resolution":{"observed_at":"2026-08-07T13:35:58.609689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T13:35:55.613828Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.613828Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f79525ebc53a30f577f59ec3ee4581ca92fab8f7724308bb93b3b5e950ba7cd6","observation_id":"db5b202b-4c9f-4cf3-8395-4e90c75576e0","resolution":{"observed_at":"2026-08-07T13:35:55.613828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T13:35:55.747382Z","title":"standard candles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.747382Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:052db66399d535091178fae276aa72f622b5cbf2c8e866a639946af3cc2e05db","observation_id":"ec4bb7de-61fa-4edc-990c-b6107dad8896","resolution":{"observed_at":"2026-08-07T13:35:55.747382Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.238397Z","title":null,"venue":null,"work_id":"71382ebf-45f3-4bdd-afcf-42732d4f404c","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.845493Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:81d323b7ba99814a839dc58aea3244b474ddb662e916f81d4afcc4313324658a","observation_id":"acce323f-2ddd-4261-a551-78492765c929","resolution":{"observed_at":"2026-08-07T13:35:58.331998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.063973Z","title":"This relation is usually given in a form where a graph or a formula relates period to absolute magnitude (a measure of intrinsic brightness)","venue":null,"work_id":"d6c181a8-3de9-4469-9823-ebf72e27f8d4","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.913862Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:3134b2292ec3f716d179e20a1f24a315fadc5083a54fce5102ae1aab036dc3e4","observation_id":"e6763064-39f5-48b3-b01b-87fda9d95806","resolution":{"observed_at":"2026-08-07T13:35:58.140035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.797835Z","title":null,"venue":null,"work_id":"394a22e7-76f2-4cbe-81ef-070e9a86bbc5","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.981091Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:66416091f24c67265f79eecacf44ed7c8a431cc052dfc13f1a3514dc327253c4","observation_id":"120c5616-51b9-4211-9664-27fd8f35cbdc","resolution":{"observed_at":"2026-08-07T13:35:57.928563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.630169Z","title":"\"\"everyone else is doing it","venue":null,"work_id":"f71c1a4f-d0d0-4737-979e-7090b4f4ac8f","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.073560Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:8faef6d5fa3528edf330d0750406a96ff703a45a3edfdca3368c015fbb0bf55b","observation_id":"0edea18e-4c38-4d9f-974d-6f07835b4b5f","resolution":{"observed_at":"2026-08-07T13:35:57.686510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.344803Z","title":"Their reasoning is fear-based, and they view rules as set by authority figures","venue":null,"work_id":"2fbc264e-3e69-433b-9471-805824e8a4d8","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.170121Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:cf2c13250f8177e8b41f1f92457fab1210d4302d04bee7cf1f3143c30a20d78c","observation_id":"ecf44972-dfd3-463b-97e4-8ff3ab1de69d","resolution":{"observed_at":"2026-08-07T13:35:57.494309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.067024Z","title":"what’s in it for me?","venue":null,"work_id":"d9b9174d-0639-4b30-a6af-4604c16ab48c","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.253150Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:1345453371599b4a9e3433ced9172ab7bdfca760e79ab2108b3e7c88470451a3","observation_id":"ef0107df-7832-4415-b647-576f0b7fd712","resolution":{"observed_at":"2026-08-07T13:35:57.168558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.593662Z","title":null,"venue":null,"work_id":"46b7b514-57d9-4ac1-bc63-22e77da413c0","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.950970Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e50910957c6ec9953e0cc0c3f707f0d2116c73c0422f43a1c0a9ca8e3d969d65","observation_id":"0e3fc1d9-feba-4c02-b9d5-adcd9d901f15","resolution":{"observed_at":"2026-08-07T13:35:59.715432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-07T13:35:55.039840Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.039840Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:4ad89cdb6b52eeb9b6d41652d7c0acc7bbbf623cdbc0fa434434c2177cc1b697","observation_id":"2c3364b5-f502-45b4-9dda-64bae6f72e75","resolution":{"observed_at":"2026-08-07T13:35:55.039840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 16 inbound Pith citation observations for arXiv:2505.21493."}