{"as_of":"2026-08-06T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf9a12bdb746ad3564f7824a850f1f503e6af7a02671575a8b5ac73a1090999d","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T07:39:02.616294Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:42:55.896502Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:09:58.372131Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2602.03452","last_updated":"2026-05-06T05:26:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-03T12:17:25Z","title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:50.793194Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2602.03452"},"observation_digest":"sha256:2455089c8a41f8666468dec4b67d006681b35510d5122768d84dd5c937f4d79f","observation_id":"654e67cf-41d6-413b-9624-4a473739ed90","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:d2609a1bc204d492aa9fe85eee22361829b800294dc2a130c28b2b9f113258c3","observation_id":"7cd3a80d-c4cb-4415-91c8-c3456a6b27fe","resolution":{"observed_at":"2026-05-25T07:26:41.698773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2604.27358","last_updated":"2026-04-30T03:15:05Z","snapshot_observed_at":"2026-08-03T04:44:07.660806Z","submitted_at":"2026-04-30T03:15:05Z","title":"Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T08:03:21.322567Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2604.27358"},"observation_digest":"sha256:bba4976d838c2129fa3303cb21443bf9950faf6aac0465359263a230987f02d7","observation_id":"867d0078-04a0-4ca3-a092-f0847c039b03","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:569778ab6646fe2ad35725e404bb3057c84d6ff5f0d378ab7b3ece703ee5a629","observation_id":"8e146cf6-da76-484f-8e82-84205622ea8f","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T15:35:08.202464Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:f4b5af007b883b7c63d8d3ba0bfb156d1e87fd33fdc67115dbb55c7708c6603f","observation_id":"0b992994-1517-4b56-86f4-b551dfc53705","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:55.375541Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:aaade54ae83001434f774642195d36f8a9c7b8815fb5ef2c0212a14139085358","observation_id":"f24dfe78-ec82-400c-9273-e4294abc199b","resolution":{"observed_at":"2026-07-01T13:15:46.696413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.06732","last_updated":"2026-05-11T21:19:23Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T12:51:32Z","title":"On Training in Imagination","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T01:00:03.971064Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.06732"},"observation_digest":"sha256:c482767bdb62f61570fd2bdd716c791eb7da3167a3d072188269bcd09c1d503d","observation_id":"90abc5e3-fd0e-4dcf-86dd-f9bd22d5553c","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.06732","last_updated":"2026-05-11T21:19:23Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T12:51:32Z","title":"On Training in Imagination","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:35:12.364580Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.06732"},"observation_digest":"sha256:ed3a282b937044f4596f6e374e8c3c12c0e848cffa693c8202659f8624d2aca7","observation_id":"3201df72-89be-48d6-a86c-e32e32d626d1","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:02:35.271960Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.20164"},"observation_digest":"sha256:6527c4afaa5825122336ab4e45388c1429a0a8329b73625b57669eb76475603f","observation_id":"79184117-1bb2-420d-a45a-d9eba5009c89","resolution":{"observed_at":"2026-05-25T03:01:06.910934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2605.25252","last_updated":"2026-05-27T02:30:41Z","snapshot_observed_at":"2026-08-02T17:57:48.310756Z","submitted_at":"2026-05-24T20:28:12Z","title":"Quantifying Empirical Compute-Supervision Tradeoffs in RLVR","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T11:46:34.688973Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2605.25252"},"observation_digest":"sha256:b0eda41e9a5c5c26bbdc9160bb9b842c2190f829c78e1cca7eb07aed75665240","observation_id":"174ff37c-7b05-47ae-8741-77b7a89b6440","resolution":{"observed_at":"2026-06-30T11:54:38.515532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:e64cc9d12e3464edc1dcdb0ecc01a68ebd4430ea90002733c3bfc87ad698dc11","observation_id":"9e8c54ab-3f8d-4d17-8172-952d8a433308","resolution":{"observed_at":"2026-07-02T06:06:40.805627Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":"2510.00915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-04T17:09:58.372131Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","venue":"cs.LG","work_id":"12cfcad6-e768-4ecf-9455-0e5bdb645f9a","year":2025},"citing_paper":{"arxiv_id":"2606.24515","last_updated":"2026-06-23T12:46:29Z","snapshot_observed_at":"2026-08-03T11:47:51.498793Z","submitted_at":"2026-06-23T12:46:29Z","title":"Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T23:58:48.558959Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2606.24515"},"observation_digest":"sha256:a097b7a4c6c566dc247069db2f8f69aac7188b868a512be007caf8c89116edeb","observation_id":"25ed3ebf-92e8-4346-ad5a-a39ad9ba6a7a","resolution":{"observed_at":"2026-07-04T17:09:58.373417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-14T07:36:47.336670Z","title":"Rein- forcement learning with verifiable yet noisy rewards under imperfect verifiers.arXiv preprint arXiv:2510.00915,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11022","last_updated":"2026-07-13T02:41:16Z","snapshot_observed_at":"2026-07-16T23:19:09.091393Z","submitted_at":"2026-07-13T02:41:16Z","title":"When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T07:36:47.336670Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2607.11022"},"observation_digest":"sha256:f2c4d1d8cf6f1f188c3a35abe96d69efc7979ba1c09169614e586bcb2d8e15bf","observation_id":"8f3545b0-d73a-4bde-8b0a-e2a7dab37ef9","resolution":{"observed_at":"2026-07-14T07:36:47.336670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"Reinforcement learning with verifiable yet noisy rewards under imperfect verifiers.arXiv preprint arXiv:2510.00915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-07-13T07:16:50Z","snapshot_observed_at":"2026-07-16T23:19:14.481825Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:fd9d2701f24796d73c78b5d9a42502729210f2565c2ef0619210c12a63146129","observation_id":"66b87979-c00d-42da-bec4-df343babbee9","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-08-06T00:42:55.896502Z","title":"Rein- forcement learning with verifiable yet noisy rewards under imperfect verifiers.arXiv preprint arXiv:2510.00915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-06T10:14:36.548390Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:55.896502Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:f040fbbba4bd7beccb49d4f38510e0f917e8cea7a22aac05ddc371d541702f6a","observation_id":"1b80d79f-183c-4525-94a0-aabd8181c5d5","resolution":{"observed_at":"2026-08-06T00:42:55.896502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.00915/citation-record","integrity":"/paper/2510.00915/integrity","json":"/paper/2510.00915/citation-record.json","paper":"/paper/2510.00915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humans or llms as the judge? a study on judgement bias","venue":null,"work_id":"fd529623-bd24-47bb-8259-acd97af43b7e","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:b19bb92a8f69d4cad14c3b69c111950e02a83b14ed4dc39e3e2c76328d6d7983","observation_id":"98a42c9f-8dd1-4fd8-86df-9b419ee7c54f","resolution":{"observed_at":"2026-05-25T07:40:29.455528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:70bfe5b3241b09a69a564e58909bf75306c35e2c6c9e8a89a6ed683ebabf850d","observation_id":"5b1f62e2-a05e-48e8-be83-1d5cfb58eeac","resolution":{"observed_at":"2026-05-25T07:40:28.751883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:1cac9d9fb296a3ae96780af9412cb3f4e3c58bc7786c6a08312206ad2ab2fb6a","observation_id":"6cf54ce2-4b73-4090-ace2-891ee0fa57c3","resolution":{"observed_at":"2026-05-25T07:40:28.726804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tsang, and Masashi Sugiyama","venue":null,"work_id":"9ba6cbb3-e357-40dd-8962-86beb35bfecc","year":2018},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:545674d52fdad3c9d8d46b60ea55b4cf970863ef11c390eb47a20216ba744c41","observation_id":"cfc6d225-1581-4626-bc4a-a22d52aad147","resolution":{"observed_at":"2026-05-25T07:40:29.410710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Olympiadbench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"21df5ce2-3dc3-448e-a502-7efad89277f5","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:31d2005ba3c2d829df7a2acf289086a13cc93e7aa580f0dd07ba2e99a2bfb3db","observation_id":"ec6db028-df06-4282-b6c0-6ea20784e4b8","resolution":{"observed_at":"2026-05-25T07:40:29.431262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4595b01-58e9-4159-9e0e-78e4df915d05","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:c59fe248d6cf8e8119a01700e2321ac06f4c193d218b230be7d2ed7655330e28","observation_id":"13751c81-e454-48d6-8873-9e1569bb6b39","resolution":{"observed_at":"2026-05-25T07:40:29.407612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T06:06:40.751284Z","title":"Pitfalls of rule- and model-based verifiers–a case study on mathematical reasoning","venue":null,"work_id":"606127e0-cfd7-4548-893d-87fb5c3ea69e","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:c261a854ca1aaafc2d78f0647cb0dc8b3fff70f5f5047a3fcb9adb5301d0d2db","observation_id":"672b0dbb-c5a9-4d03-815c-bee38f6723f6","resolution":{"observed_at":"2026-05-25T07:40:28.688777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Math-verify: A robust mathematical expression evaluator for llm outputs","venue":null,"work_id":"2fe48c72-4107-4719-bdd2-b639147f01da","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:9301803c93aaf4422bc7d0a9263995210759da2098fb0294a2e90e1f71f1da64","observation_id":"67004685-a161-459d-aeb9-fdb090bdf9a4","resolution":{"observed_at":"2026-05-25T07:40:29.417539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2024 (dataset card)","venue":null,"work_id":"adb0d236-7eaf-43da-8e51-de1763b6445a","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:67a76abfa9c559764d384ae33f41fb90602f864adda4656353516261ec9dbe26","observation_id":"fe4af45a-803b-4425-b277-1b2dbbe0ec68","resolution":{"observed_at":"2026-05-25T07:40:29.427426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mentornet: Learning data-driven curriculum for very deep neural networks on corrupted labels","venue":null,"work_id":"fecb3711-f131-4ebb-910a-1bd60b68fc1a","year":2018},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:8d985feddad3018dbf93f06c3a91e3feca380fe0926db029d48cc391bbfeb4a7","observation_id":"5b15f4a9-442c-4e69-861f-d0618433d0d1","resolution":{"observed_at":"2026-05-25T07:40:29.424226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.01234","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the admissibility of horvitz-thompson estimator for estimating causal effects under network interference","venue":null,"work_id":"62dcc400-cdad-491f-ab98-120cbe1c0ab5","year":2023},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:357096d65648ac1dd825b94e7b37f04a7024d542f2e04f16018a715779070a56","observation_id":"78e1f08f-5f86-4ebe-912e-db9b436c5afb","resolution":{"observed_at":"2026-05-25T07:40:28.699666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra","venue":null,"work_id":"0d8274e4-c17b-46fa-88df-a177b82de6b2","year":2022},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:18a2e2017d13ba387619245e838ff1978e622a2fcb3bc981b7264e6c2f9abe3d","observation_id":"393979c1-d642-4b18-a3de-f05aed788606","resolution":{"observed_at":"2026-05-25T07:40:29.499409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a3c95018-ea70-4758-8d1a-1d788806a2a5","year":2020},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:5fa3a9c181787b4394a27356ffcb929e448c21526e30ad975f7d45e5c230b83c","observation_id":"dc68112d-0c0d-482a-955e-bdd1df293ef6","resolution":{"observed_at":"2026-05-25T07:40:29.503167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Provably end-to- end label-noise learning without anchor points","venue":null,"work_id":"38762183-f4b2-4d6a-9f39-8037d501a12d","year":2021},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:4c8d272c9e51165212da4001b4cb05a8ed6b144e5640b870141951cf450a92ca","observation_id":"fdc0212d-58bf-4c1f-94a1-ffe23d5ad8f8","resolution":{"observed_at":"2026-05-25T07:40:29.484272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":"2507.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-01T20:56:13.335126Z","title":"Verifybench: A systematic benchmark for evaluating reasoning verifiers across domains","venue":null,"work_id":"901f1726-1a8d-457d-96c3-40dcb729f89f","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:a9ca65c78196cea6a72cb00c38baf13fe71a9a2d11a5b35464b45d1611dd1cf7","observation_id":"0f8dab58-f029-481f-9742-466f818d888a","resolution":{"observed_at":"2026-05-25T07:40:28.733858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.530067Z","title":"Let’s verify step by step","venue":null,"work_id":"491400d6-7848-4c99-bdc4-aa630747f639","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:5bd7237a92f1cbc8bdecfb0f4c6bd33681c4a673d01d8be6defb8d7e5b28fa9c","observation_id":"0a53b119-b40e-463c-8796-818143a268c9","resolution":{"observed_at":"2026-05-25T07:40:29.487892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"cbed1072-1dff-4215-b519-7b7d0465696e","year":null},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:766ceb6b3e208b70c17a70732a91acbd674c3a80aefbe5bdab8fa48a64039ad9","observation_id":"436a6792-4ac2-497b-8b72-dbd9ee9552c7","resolution":{"observed_at":"2026-05-25T07:40:29.491510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amc 2023 (dataset card)","venue":null,"work_id":"47d7f424-efc2-4eae-b258-872ddf15979b","year":2023},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:09e50d1816bee0e5e59042cda3b729e5be0ea1a5fa267d67ee1ac961bfeb4917","observation_id":"9770835f-3db2-4180-848a-6a87e0f73ce9","resolution":{"observed_at":"2026-05-25T07:40:29.480701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.06639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:09:40.613714Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dy- namics, and success amplification","venue":null,"work_id":"6fe29bef-6823-4df6-870e-d01a3e5e3ea7","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:ae41ba69e9bc4763324e6be446e0599e5d85372a1fb4297f6b12ec1b0fe76b37","observation_id":"bf1f2286-cc07-4f85-8e17-eb0a1772070c","resolution":{"observed_at":"2026-05-25T07:40:28.705425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dhillon, Pradeep Ravikumar, and Ambuj Tewari","venue":null,"work_id":"b76829a8-c52b-42fa-8018-5c7b62dd4d59","year":2013},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:4204b011d2a09835d2e0095bec46c355973e49f30db6cee9e804d7c7c329977d","observation_id":"3911a067-e284-4931-a6a8-3ed17e9ea3d7","resolution":{"observed_at":"2026-05-25T07:40:29.466642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2025 (dataset card)","venue":null,"work_id":"09bfe4ed-f498-48b4-bc6a-663cd1be2c87","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:0776abc9f8120e4c318df65d7a21c10637aae35fa4ad24fec4dbcbecd97173a5","observation_id":"7e1e6cca-c539-4fcc-a26d-0d2178f5d2de","resolution":{"observed_at":"2026-05-25T07:40:29.469960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making deep neural networks robust to label noise: A loss correction approach","venue":null,"work_id":"cb1c23b5-16c9-4379-b4d3-439c90679bd7","year":2017},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:faf544cbc4cfde5d2a1ab579fffb71cf8e81221ffa0db0f7052652731f2d96b6","observation_id":"d330f054-da8d-4ba9-81bc-7e1a3e718552","resolution":{"observed_at":"2026-05-25T07:40:29.473787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:f665ad1c71cae85e768a27ae0558cb7ff208c5102d2346a6404c7f21879ea80d","observation_id":"23225b11-a7e4-48b5-b6f7-b4010f1d6d83","resolution":{"observed_at":"2026-05-25T07:40:28.758312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization-based prompt injection attack to llm-as-a-judge","venue":null,"work_id":"9d471a60-304e-4ff2-9e7c-1c88a61317c7","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:6c82c99f44812959231d8ec00edaf65194e1f3448bc2cf89a7ceaaa2ce831b79","observation_id":"6ee03e51-64fc-4af9-8e3d-2303cf4c3e9e","resolution":{"observed_at":"2026-05-25T07:40:29.463272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.07791","doi":"10.48550/arxiv.2406.07791","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging the judges: A systematic study of position bias in llm-as-a-judge","venue":"arXiv (Cornell University)","work_id":"11308458-d080-4667-b088-70cc9c815627","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:379c4541ebcdce8688324841330334b0d432df98100e9ba8afe88e88cf43427d","observation_id":"ba3d881c-324c-4ce2-a3cf-d7f3fcc49825","resolution":{"observed_at":"2026-05-25T07:40:28.716419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from noisy labels with deep neural networks: A survey.IEEE transactions on neural networks and learning systems, 34(11):8135–8153","venue":null,"work_id":"6147a361-991a-4358-9e79-1e93789b830d","year":2022},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:22ff1034e811aa94ef2f2f9dceff06e12de6c138e32e1c34dd1c480ae921e218","observation_id":"f61f0ddc-b7cf-42b9-960b-a0f3b08efaac","resolution":{"observed_at":"2026-05-25T07:40:29.450869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutton, David A","venue":null,"work_id":"c204c25b-c833-4c30-92b5-3c2394cda048","year":1999},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:6150cd2970e971af0cd9eeb80a780265cda41c3b518d9f58c235de0cc5853e9b","observation_id":"803f7d05-7a98-4018-b59c-8439205fd533","resolution":{"observed_at":"2026-05-25T07:40:29.459332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":"2406.12624","doi":"10.48550/arxiv.2406.12624","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging the judges: Evaluating alignment and vulner- abilities in llms-as-judges","venue":"arXiv (Cornell University)","work_id":"d0e0145b-d0f4-43ff-8b70-fee617aaf5c5","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:27c8d74f557e329eeda3c7272a7de7ae7a6cc824235282cb42e955b820114d14","observation_id":"b6917440-946e-479c-b0d9-ecf3803b79ec","resolution":{"observed_at":"2026-05-25T07:40:28.682665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with perturbed rewards","venue":null,"work_id":"4f73671c-08dd-4a70-8f8c-a73729dff655","year":2020},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:3364d63cb0b806ca7d36ccabf01e1237f1b542d5cc74b11339253f0e2de585f0","observation_id":"766537cd-43be-420d-99c5-1dd1ffeea564","resolution":{"observed_at":"2026-05-25T07:40:29.477459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, Ed H","venue":null,"work_id":"63dd7bd1-0838-49c4-b69f-d72b327b9a73","year":2023},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:2dbbaed833ccafc2b7da1088c575a94da99dc61e28fa3023f041f46a362018c8","observation_id":"62f00431-e7b5-45eb-88e1-d987b8b61f4e","resolution":{"observed_at":"2026-05-25T07:40:29.446624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi, Quoc V","venue":null,"work_id":"6cacca05-f830-4951-b499-8e16b997b491","year":2022},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:dfe6f583b4a46a9dcf748126c675122a0fa266430b7e8a3a6c52a57a3bc78088","observation_id":"659faf64-8df3-496c-95ca-e5846f62ef08","resolution":{"observed_at":"2026-05-25T07:40:29.443002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:451791afed23e3570769f41f8a3143ad90c18f6ada9cb52fae04ed269d879f5c","observation_id":"7b46c176-c529-496e-a393-add5908b0750","resolution":{"observed_at":"2026-05-25T07:40:28.693870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist rein- forcement learning.Machine Learning, 8(3):229–256","venue":null,"work_id":"ad9de274-b638-4ffd-b970-c1385685e247","year":1992},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:dfeb646849605875399f13498a9ef7f185f967c9a340aef54c2141309da61332","observation_id":"961c2790-f0b7-40dc-b5f0-5e5033e93272","resolution":{"observed_at":"2026-05-25T07:40:29.435272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-03T22:59:07.639277Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:edf9cdc8e7e64a84bea946e74dbb06b570e4d3982590222b7fcebefbc8cfefbd","observation_id":"3e48e768-8302-413e-96bd-f89841ee7373","resolution":{"observed_at":"2026-05-25T07:40:28.721581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"e146f4de-da5b-411e-8c11-5b06c88ef229","year":2023},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:dc3a299af2e5c692dfa25a019f484d57f55b8d282d9a7027945bd3f4ed1670d4","observation_id":"03019534-bcb7-4898-a55c-d0087e35b302","resolution":{"observed_at":"2026-05-25T07:40:29.439389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-07-06T21:55:50.206625Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":"2507.08794","doi":"10.48550/arxiv.2507.08794","metadata_source":"pith","pith_arxiv_id":"2507.08794","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One token to fool llm-as-a-judge","venue":"cs.LG","work_id":"f77305eb-5f89-4afb-84f3-51d864f3f3fa","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2507.08794","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:fe1a231a50e3c72b022a7471a4c323e6c12bd36f5a1aa8e06abb033c9a5aab27","observation_id":"64ea9ca2-05db-47ec-b342-b7b6cf48bc8d","resolution":{"observed_at":"2026-06-12T02:08:19.458599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le, and Ed H","venue":null,"work_id":"b5f2afd9-8735-4060-a7b6-a92230a32965","year":2023},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:81af5b907761eb3c713911fc11d00bb8137ade8813392e26ea3bbabac7093c95","observation_id":"d2c87dc9-fff0-4824-93a2-d41d09d8393a","resolution":{"observed_at":"2026-05-25T07:40:29.495794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2baf15f2-7c21-4d4e-8ab7-ca4e5d00a8cd","year":null},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:f80d853a5f5486c3d0e031f8705d3bd57f786894e467e0cd09f4ba75d274045d","observation_id":"7efcb9d8-13b8-4993-a24b-ccb40a4b1340","resolution":{"observed_at":"2026-05-25T07:40:29.420861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"idx\": 16","venue":null,"work_id":"b40398f9-06d6-4d98-8cb9-b1b5695a4c24","year":2024},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:2421256ab90b88461d5b2a04eb85d8f60f31b6776d4e3a10a4de32398be16639","observation_id":"e37b77f1-0056-4641-b1de-d252703fb3af","resolution":{"observed_at":"2026-05-25T07:40:29.414055Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":12,"verified_fuzzy":23},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 15 inbound Pith citation observations for arXiv:2510.00915."}