{"as_of":"2026-08-07T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc85ef3a3664d2657ab97c3d6bd9269c74a79b0df570475680f58eea50d1d09f","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:37:51.086217Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:52:05.462042Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2505.14412","last_updated":"2026-04-19T14:17:44Z","snapshot_observed_at":"2026-07-06T21:27:08.958780Z","submitted_at":"2025-05-20T14:26:19Z","title":"PRL: Prompts from Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T14:25:22.002977Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2505.14412"},"observation_digest":"sha256:4e124b8697d0c503073cc7afa270129fa30a27a88124c04ebd7640fe64412f6c","observation_id":"41dbb91b-0dd0-4c7b-b90f-4ef002dcd815","resolution":{"observed_at":"2026-05-22T14:26:40.402303Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:52:05.462042Z","title":"Zettlemoyer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-06T22:44:10.264269Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.462042Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:f3bbc7aaa43fed6549d638156303460d2ee1158b47e581e33abf842f5967e6ff","observation_id":"4c0b8fcf-9b99-4446-8d7e-3af410306ce9","resolution":{"observed_at":"2026-08-06T22:52:05.462042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:45:02.881915Z","title":", Li, S S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-06T22:38:57.552207Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.881915Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:bcb24f697d7fe5ee8b9570849b6266fb17874fd7ebd2f622c601ea7918d8d1d0","observation_id":"870979c2-4e34-441d-8bad-e60b4bcbc6c5","resolution":{"observed_at":"2026-08-06T22:45:02.881915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:21:41.942088Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.942088Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:1ec3c57d179d7900102ddae972c2b3e02e971eea4d748a87e9e8b82e79ef35eb","observation_id":"4cef041f-37dd-4886-a7f6-26e174124b9c","resolution":{"observed_at":"2026-08-06T21:21:41.942088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:13:15.096866Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-06T21:06:13.281350Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.096866Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:12a65c9bf6fbc15bff150ea255a7197729d5e2fb238e25632addebb3a3aa45f3","observation_id":"bf7edc7d-f230-4347-9a5c-06a11217689c","resolution":{"observed_at":"2026-08-06T21:13:15.096866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:5e1553eb7bffe2ec4eac63d821bd8826422be88a39c4ee20d1f08cfa644a4585","observation_id":"349ccc8e-5008-48bf-8d04-fdc34e30e3e7","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T17:17:06.284535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11408","last_updated":"2026-01-19T08:53:46Z","snapshot_observed_at":"2026-08-06T17:05:59.820229Z","submitted_at":"2025-07-15T15:28:37Z","title":"KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:17:06.284535Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.11408"},"observation_digest":"sha256:0fe95c4e71b8c5f4984fe1f0555634be9a943b004ff81b3544eeeb43b9471d3a","observation_id":"9ebc9ced-6798-441c-9ce9-e5b486c46400","resolution":{"observed_at":"2026-08-06T17:17:06.284535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T16:34:25.176219Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.176219Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8d85a176976459c27ea5cc10affe59393db72f3a57901e8441419d0f1a9cac43","observation_id":"c615db8a-b98d-4bb0-aa2a-419d1f96996b","resolution":{"observed_at":"2026-08-06T16:34:25.176219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T15:29:13.444701Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-07T08:12:57.119379Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:13.444701Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:abb8b2b02991f673117f44333b88ee853d21c816d0fe9f983e1737d09393f941","observation_id":"24d1b1ce-3df5-47ed-81f1-c779200c85d5","resolution":{"observed_at":"2026-08-06T15:29:13.444701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T23:10:24.501625Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-06T23:48:50.067686Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.501625Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:e735f229711c831c6adc89c211c5803496858bb405419aecc9953bd7519f436a","observation_id":"e6e576f3-303d-4653-9fa9-de1668690b16","resolution":{"observed_at":"2026-08-05T23:10:24.501625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T21:12:11.863783Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09303","last_updated":"2025-08-12T19:38:21Z","snapshot_observed_at":"2026-08-07T12:04:31.853290Z","submitted_at":"2025-08-12T19:38:21Z","title":"ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:12:11.863783Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.09303"},"observation_digest":"sha256:0eb54cafd5c014cfc59f4ef57d080b38d24c97bbcd7eafe3470b968d803ba899","observation_id":"2adda67e-b61d-4bfa-a97b-07329c450e82","resolution":{"observed_at":"2026-08-05T21:12:11.863783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:21:08.167577Z","title":"Spurious rewards: Rethinking training signals in RLVR.CoRR, abs/2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.167577Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:6b7354ca36e4dcecf3f56fc55bdaa55092df35e123fa7e23bec357f32ca3fb8a","observation_id":"06d7b561-f235-48b0-80e6-e4599b64f9c2","resolution":{"observed_at":"2026-08-05T20:21:08.167577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:04:02.795840Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-05T20:04:00.659293Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:02.795840Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.11356"},"observation_digest":"sha256:a45fb80e7a40cfde5ad93e58ee00ae2724bdd4ca156ba9f2b591ab0d29bb4e9b","observation_id":"936e5643-2132-4e42-b7ff-7ab06ed3bc6b","resolution":{"observed_at":"2026-08-05T20:04:02.795840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:b8a514be20964e35eb1b3862a9ada3dd5ddf00e6864d99d4fd5a8f8b9075c7a9","observation_id":"e84b70b4-5be6-47c1-8bf3-377ccab63756","resolution":{"observed_at":"2026-05-18T21:06:50.837840Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T10:31:37.869115Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-05T10:31:32.575543Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.869115Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:465fb3aeb1244a8aa642e1902be5c633f0d1650ac46b54f034bed90749ec401f","observation_id":"70d53b55-92e9-418f-8b2e-2d0617b2bff0","resolution":{"observed_at":"2026-08-05T10:31:37.869115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2509.18052","last_updated":"2026-04-06T17:12:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:27:29Z","title":"The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T14:31:11.974395Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2509.18052"},"observation_digest":"sha256:148a7dbc66c24e86444cf55c74ee32d0894a40e8ff6738001ebafcc15524334a","observation_id":"37a43eb2-b4c8-43e4-a591-5430be5eb915","resolution":{"observed_at":"2026-05-18T14:31:29.537032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T12:59:01.622788Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01427","last_updated":"2026-07-30T00:32:01Z","snapshot_observed_at":"2026-08-04T12:58:57.066330Z","submitted_at":"2025-10-01T20:06:48Z","title":"A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:59:01.622788Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.01427"},"observation_digest":"sha256:0316a97870bb3691b4bd7b1564ab56c7863533c1ec771498c11d0e47749b34ad","observation_id":"d69aa6bd-aea1-46e4-914e-affbf4746d30","resolution":{"observed_at":"2026-08-04T12:59:01.622788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T11:23:20.230179Z","title":"Spurious rewards: Rethink- ing training signals in rlvr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.230179Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:5666e701870e5a0a6ec26d7824b76a6bbf31883d3d0270a6cb6c8809a166c721","observation_id":"c28a2971-a4d6-4140-b04f-4f1f68ed129d","resolution":{"observed_at":"2026-08-04T11:23:20.230179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T10:44:31.017232Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-06T09:42:32.578654Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:31.017232Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:059d56d028e88a5c59aba566a5a4ab33e7a46a50a9d241f7a40895e541c0281b","observation_id":"cdfd8145-d278-4c87-bc4a-31f25d7eed51","resolution":{"observed_at":"2026-08-04T10:44:31.017232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:11:29.205366Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:4f301f7b4c7e8f4207960c171efa11606e70f08898e7474ed860dc84bcc75eff","observation_id":"74485d24-0a0e-45a5-88f1-77a2265e499a","resolution":{"observed_at":"2026-05-18T05:12:23.642649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T20:06:16.172916Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:4aecc2662706b9e85ed64739cfb7ce1149040ce9094f4ed6a9b6f9859eea6a03","observation_id":"335e52f9-56cd-4d6e-b4f0-1f8cd628784a","resolution":{"observed_at":"2026-05-21T20:10:34.994167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T08:53:07.162212Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-04T08:53:03.599438Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.162212Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:2f69a3077740f262c6aa98189c4a354ffcf604a4c715f5f62d384259010fa96e","observation_id":"1d569e59-5604-43f3-ab7f-8d9ffc7f311f","resolution":{"observed_at":"2026-08-04T08:53:07.162212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2511.14045","last_updated":"2026-05-09T12:37:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T01:51:34Z","title":"Auditing Data Membership in Reinforcement Learning With Verifiable Rewards","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:54.702010Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2511.14045"},"observation_digest":"sha256:c54acd6ee9b25aa55c672d2aae8976ce4fee14ddbd590dffedd049109355838f","observation_id":"cd0c33e4-7ff5-4b20-b972-aed121ca57f9","resolution":{"observed_at":"2026-05-17T21:40:17.700706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2511.23473","last_updated":"2025-11-28T18:58:14Z","snapshot_observed_at":"2026-08-04T17:31:45.294646Z","submitted_at":"2025-11-28T18:58:14Z","title":"ThetaEvolve: Test-time Learning on Open Problems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:16:27.293449Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2511.23473"},"observation_digest":"sha256:153dad0f3c8896de1692f81e50d8b46876ad0302ea87c449a2eea24213791fe9","observation_id":"1b0b2d8a-1d75-447c-9764-7a64e8d2eed6","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2512.00778","last_updated":"2026-05-15T09:26:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-30T08:27:59Z","title":"What Is Preference Optimization Doing, and Why?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T18:37:48.161545Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2512.00778"},"observation_digest":"sha256:aaa05edcf528876e3611649f072227d048f8d1a4a0e77cc81cbda2b9dfeb058d","observation_id":"5ec94834-9f43-4502-8714-d84f68b76924","resolution":{"observed_at":"2026-05-21T18:40:28.955681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-03T10:13:15.212310Z","title":"S., Xin, R., Geng, S., Wang, Y ., Oh, S., Du, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.212310Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:8c4a202cdb79abf4c496017c2c0836856b5bbf06a9686e5254166f8849dbf41d","observation_id":"b03b36f4-d86f-4452-be41-ff46f16d8cf7","resolution":{"observed_at":"2026-08-03T10:13:15.212310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-03T03:04:44.283684Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-03T07:10:48.024369Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.283684Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:d8f57b14c1abd1f7cf5981088521394e0291acdf57432216bf3e154107ac776f","observation_id":"2a3f5c8f-3e25-4b3a-b2a9-fe248c574759","resolution":{"observed_at":"2026-08-03T03:04:44.283684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T23:11:55.977680Z","title":"S., Xin, R., Geng, S., Wang, Y., Oh, S., Du, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-02T23:11:47.613570Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T23:11:55.977680Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2602.14872"},"observation_digest":"sha256:c22b5bdbce6446454260ddd57fdeefad92fe2e45c0145da2ed0c638b16cfd6e8","observation_id":"0359888a-b996-489a-a866-91570c1013e8","resolution":{"observed_at":"2026-08-02T23:11:55.977680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-02T22:11:20.734730Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T19:23:10.901441Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:570b27b7e9616cad78a3ee5dcd46868a273f0a2bdd6b926edec666795aa4509d","observation_id":"33539e0f-63bf-4dd7-99df-98f992a9cac4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T16:52:29.593103Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-02T22:11:20.734730Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:29.593103Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:ed01de5101843026a6a673c285ab8ab7a3918721ad7cd62a2f93ea41d955f88f","observation_id":"00440b3d-9da3-4d3c-9dec-6331025970ee","resolution":{"observed_at":"2026-08-02T16:52:29.593103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.15830","last_updated":"2026-05-01T11:47:10Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:34:51Z","title":"Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:30:40.368494Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.15830"},"observation_digest":"sha256:3f2f04dcad5a25bc0ac0f97f0a706e047c675d3c22a2230eea17bc0f210ac108","observation_id":"888f70ca-4c29-4f1e-b9cb-33d0d227567c","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:e9d67faaec7d010699d81147e94445c4b6fbbf93d37682a980a0d9ed656c7729","observation_id":"766f1fee-28d3-414c-892a-3872cab38956","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17312","last_updated":"2026-04-19T08:01:31Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T08:01:31Z","title":"A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T06:38:22.041842Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17312"},"observation_digest":"sha256:41e0db0852b908c3bf82ca5b3df9620e81a7d1decd8fbd18ae607e6ad297e4f9","observation_id":"fa7f8d2c-efbb-4c43-bc3a-a4de58daa56a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:019e75291d7198d5523590146799baca4e862cd12b33cacee190c398ded8be4a","observation_id":"c4a486c9-bda1-4833-9791-dc67fc342346","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:3b8a793f83a15f84a0f1733b1442dced99f7d0f72a18030d72d239c80374d8f7","observation_id":"8597c541-ade7-44b2-990d-16382fbae164","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.23747","last_updated":"2026-04-26T14:53:48Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T14:53:48Z","title":"SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:34.968571Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.23747"},"observation_digest":"sha256:6d12970e6ad76f63ace4221d92c1711da5af38ecec339c5edac32a96e3a310b9","observation_id":"c955551c-4937-4047-b106-13062012e8e4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:de8fedb60a30b224ac30683f47e951318cf4cca708c29016e99c3ac2fa934696","observation_id":"9d6aea07-dd05-4d32-abd4-019fd8f4337e","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:538135c2c89c80d49237746c76ccb7eb00d4517a5db6f1b02bec003976b9b29b","observation_id":"f0af7455-69d4-43f4-a332-c2eef49e8601","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02427","last_updated":"2026-05-11T20:46:44Z","snapshot_observed_at":"2026-08-06T12:18:54.522744Z","submitted_at":"2026-05-04T10:26:34Z","title":"The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T18:58:22.865080Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02427"},"observation_digest":"sha256:24cf70a25fa16730ec8df80f4055f738951da30ecf68e45ad23b8edf8e97df4d","observation_id":"c23d3da4-be60-49fc-9edb-5f45b380306f","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02427","last_updated":"2026-05-11T20:46:44Z","snapshot_observed_at":"2026-08-06T12:18:54.522744Z","submitted_at":"2026-05-04T10:26:34Z","title":"The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T02:14:17.870184Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02427"},"observation_digest":"sha256:b35bbe314ab4f8c498d9a628ae5dad6fac3dfae390a603a978b7f511653bc51b","observation_id":"c802e97d-8c70-4acd-bf93-69ab6ad87b2a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:064a0d8755b801c39e54ecb604514d67bd5ecf73232f7798750a2d425d23d552","observation_id":"3c315a2b-e9eb-49b3-ae7e-cf7e89165677","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.04542","last_updated":"2026-05-06T06:42:47Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:42:47Z","title":"Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-05-08T16:53:00.860162Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.04542"},"observation_digest":"sha256:a2fccf8022d23cd0c90c5754da3463d6e03674f79246e9e151e34f043d2bea80","observation_id":"3d0b2257-17ee-4361-83c5-0afc8b6c230a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:a575e408ed2c9947c7b595206f25b779217a85ed70146c680c2c230096a92119","observation_id":"50827bcc-6bfd-4371-ba76-e13d04f92767","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.11813","last_updated":"2026-05-12T09:06:08Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T09:06:08Z","title":"Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:15.799220Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.11813"},"observation_digest":"sha256:2b37354089e833658b990135968164fca036d9f8abb9ad9e6b1813536893d72b","observation_id":"1f867728-d6a6-491d-b6aa-2af9f8caa81e","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:df560836ab66b42784ab5ff372d02ce807fcbf80bf0d09414bec012ff7c08f44","observation_id":"cfdb2cf9-250d-4247-80ff-9601d85bf7b4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:8bf8dc07af392beb196aceb34d5bdad61316d89a1b652a73dc1fc6e6a5f86a18","observation_id":"726a0883-aeaf-4dd3-a01c-6345737dee68","resolution":{"observed_at":"2026-05-22T10:01:22.952772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:51.578772Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12474"},"observation_digest":"sha256:0c58d782274558074457c89508783b172796f99c05cd95ee8600930715ec8ae6","observation_id":"dc8355c6-b564-4f6c-a35c-fce4c1af9507","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.14445","last_updated":"2026-05-14T06:39:42Z","snapshot_observed_at":"2026-08-01T15:27:40.908509Z","submitted_at":"2026-05-14T06:39:42Z","title":"FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:02:25.597640Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.14445"},"observation_digest":"sha256:62e575fa3725fd509c420b08f17b51f2ef237fdcd40ea5ed8c5a22838f14206f","observation_id":"2a608b4e-ddbc-43ba-8a18-56c3a284fbe7","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.20066","last_updated":"2026-05-19T16:20:57Z","snapshot_observed_at":"2026-08-04T01:04:10.985085Z","submitted_at":"2026-05-19T16:20:57Z","title":"Text-to-SPARQL Generation with Reinforcement Learning: A GRPO-based Approach on DBLP","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.20066"},"observation_digest":"sha256:c68b7f0d8a2fb76314920785f26114e6f9a2aa6fd5ec9aef47e0dc471aa66014","observation_id":"982276db-f770-4500-a269-4fe318c9a47a","resolution":{"observed_at":"2026-05-20T05:33:03.662351Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:02:35.271960Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.20164"},"observation_digest":"sha256:306653aa9c3542398de9ee89bb9c028d619d9d424c8e34af277b93a0211a5409","observation_id":"a9bcd287-bdb8-46ac-af5f-ae14cf350702","resolution":{"observed_at":"2026-05-20T05:03:03.508869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.29009","last_updated":"2026-05-27T19:04:35Z","snapshot_observed_at":"2026-08-02T13:50:50.347898Z","submitted_at":"2026-05-27T19:04:35Z","title":"Label-Free Reinforcement Learning via Cross-Model Entropy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T14:18:38.733276Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.29009"},"observation_digest":"sha256:dafb3a300b5ec3941040783c129dc3e544c67b2d4c65082f0c210b103794afc4","observation_id":"25f5bb25-b4c2-4e0b-9f3c-1341ed627632","resolution":{"observed_at":"2026-06-29T14:23:30.616183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.30327","last_updated":"2026-05-28T17:57:32Z","snapshot_observed_at":"2026-08-07T06:29:11.661418Z","submitted_at":"2026-05-28T17:57:32Z","title":"Reasoning with Sampling: Cutting at Decision Points","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:17:08.488565Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.30327"},"observation_digest":"sha256:bb6be96e645452216012dceb180c0bcbe91a2966a994c70691a5353f64679849","observation_id":"43107580-6423-41fe-8bb9-d97f04f04b5d","resolution":{"observed_at":"2026-06-29T08:23:15.534726Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.31494","last_updated":"2026-05-29T16:16:13Z","snapshot_observed_at":"2026-07-06T23:40:42.277618Z","submitted_at":"2026-05-29T16:16:13Z","title":"Consolidating Rewarded Perturbations for LLM Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:37:34.673402Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.31494"},"observation_digest":"sha256:f17e24766a2472e6082b9d2ef26785ed5cb8a10cfaa49051b18f1aa98a9a7d01","observation_id":"fb845395-bada-49c1-aeb5-8b25ae86e72a","resolution":{"observed_at":"2026-06-28T22:42:46.870525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-07-06T23:41:43.820102Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:c46c6396dd44cf6565155083334914b229a0a8f8b82d15331d5ebe2ebe579967","observation_id":"03f90375-e681-4bc1-915a-4f83010bb428","resolution":{"observed_at":"2026-06-28T17:22:24.873180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:f4780999dd9055f7e0b78379d504d7482ee9123fbb05e88abbc31fddd90b26cd","observation_id":"c9a30e50-d8dc-478f-a9ed-d53e814b1198","resolution":{"observed_at":"2026-07-01T20:56:13.467969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:578c5f8420d9d2a642f6575a82e86e5f1ce23aa5cac824b0163f5a9eb3622df2","observation_id":"e8950c1b-8edd-464d-bc8d-23c354c61ced","resolution":{"observed_at":"2026-07-02T06:06:40.763205Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.05932","last_updated":"2026-06-08T06:52:09Z","snapshot_observed_at":"2026-08-06T22:10:38.958936Z","submitted_at":"2026-06-04T09:35:54Z","title":"A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T01:35:26.306648Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.05932"},"observation_digest":"sha256:134f86d45f146a2a789f9de28bdd40ec132c49a1214f8004d35b15c8d39b8f23","observation_id":"e3aadc56-5a37-423e-a0c8-87ff3bbb679c","resolution":{"observed_at":"2026-07-02T13:06:59.082200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.06475","last_updated":"2026-06-04T17:56:31Z","snapshot_observed_at":"2026-08-02T05:24:28.279089Z","submitted_at":"2026-06-04T17:56:31Z","title":"RREDCoT: Segment-Level Reward Redistribution for Reasoning Models","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-06-28T02:12:16.029526Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.06475"},"observation_digest":"sha256:d1327c91c31a6f65bfe369f168bdfdc3fbf481800b9a083d165d1edc0e346f41","observation_id":"e497ec34-05e1-4055-b5dd-2c784799cdb0","resolution":{"observed_at":"2026-07-02T12:16:57.646397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-02T18:12:45.452978Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:cd8feab966f3c6360bcd2d5ebbd3acf7654a4d061cfc8bdebdb31d3189a3f188","observation_id":"4ca2855a-fccd-46ad-a9e0-0db11187f3a5","resolution":{"observed_at":"2026-06-27T13:20:56.495398Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T11:54:46.435397Z","title":"doi: 10.18653/v1/2023.acl-long.244","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-02T18:12:45.452978Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:54:46.435397Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:8ef092fbbb4ffb3f9a19cbf4cfbd451aa44858bcf9e0d7ec3a3ce0178acf8df5","observation_id":"028afbad-e9eb-470a-b0e9-1f03e1a6cc86","resolution":{"observed_at":"2026-08-02T11:54:46.435397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:8e513a61e1c3fa74f01837a09ba7269f78db082b2eaf62ad465c5ca4537a3e22","observation_id":"701020a6-8764-4e8c-886e-c8bbc61bc510","resolution":{"observed_at":"2026-07-03T20:38:55.978596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.26080","last_updated":"2026-06-24T17:54:08Z","snapshot_observed_at":"2026-08-02T15:38:18.729836Z","submitted_at":"2026-06-24T17:54:08Z","title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T19:55:51.114244Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.26080"},"observation_digest":"sha256:8ab3243155d95032f51a5435e081b2144a128bb9dfe7f330a522204d31852751","observation_id":"45b40a9c-d615-4e3b-b516-ed6555117f7a","resolution":{"observed_at":"2026-07-04T20:40:07.890098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-06T11:39:28.274986Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:d2fa6e5a0bce36916e960a4463caffc8ff60884885af44b7f5438d5265427e97","observation_id":"520d274b-f92c-4b51-a10f-b89807016227","resolution":{"observed_at":"2026-07-09T11:16:11.379832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-05T22:34:44.214037Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:5f12355db71ac4ca149fb782fe769d35e8a7b7454d8eb465a960dee78de0f59a","observation_id":"07f73784-95e0-4cbd-8408-e75d5948032c","resolution":{"observed_at":"2026-07-09T09:26:08.755245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:059176bf8eb61a3b3d90488519e9eeb70b372cda6ad912106601dc007834a661","observation_id":"353c0b54-a1fe-4d06-adee-9740cc3fc99d","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-14T17:39:27.292075Z","title":"Spurious rewards: Rethinking training signals in RLVR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09693","last_updated":"2026-06-19T12:36:23Z","snapshot_observed_at":"2026-08-06T22:53:53.156596Z","submitted_at":"2026-06-19T12:36:23Z","title":"Depth-Entropy Guided Sampling for Training-Free LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T17:39:27.292075Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.09693"},"observation_digest":"sha256:7d3d2d771e0a8877fc48265a4ff70d5e84b8da81a21b1a8e6b7130c390871b83","observation_id":"35fffbe0-93cb-4d5a-8829-f4f83000f389","resolution":{"observed_at":"2026-07-14T17:39:27.292075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-14T07:36:47.336670Z","title":"Spurious rewards: Rethinking training signals in RLVR.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11022","last_updated":"2026-07-13T02:41:16Z","snapshot_observed_at":"2026-07-16T23:19:09.091393Z","submitted_at":"2026-07-13T02:41:16Z","title":"When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T07:36:47.336670Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.11022"},"observation_digest":"sha256:c8b0224e3578591945be2d1954254fae70c8901dd00b8cccc5993895520fcb01","observation_id":"fb1244d4-f004-4d78-b606-b1105598a081","resolution":{"observed_at":"2026-07-14T07:36:47.336670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-01T17:47:41.835722Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-06T02:55:37.951193Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.835722Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:56257bd1ab063edc0fa0a8e474ae82d80dc61644409842086fda136c399a5b74","observation_id":"3348cd36-1e17-4155-90d2-f7211246e2ce","resolution":{"observed_at":"2026-08-01T17:47:41.835722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T02:03:05.632468Z","title":"arXiv preprint arXiv:2506.10947 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00019","last_updated":"2026-07-01T10:39:54Z","snapshot_observed_at":"2026-08-06T23:16:33.537207Z","submitted_at":"2026-07-01T10:39:54Z","title":"Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:05.632468Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.00019"},"observation_digest":"sha256:9fccd799573de271b45f47a7276b44c5a6c30126d609471559dc16375be7a587","observation_id":"66b24e57-486c-443f-a922-b8654f6369e8","resolution":{"observed_at":"2026-08-04T02:03:05.632468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10947/citation-record","integrity":"/paper/2506.10947/integrity","json":"/paper/2506.10947/citation-record.json","paper":"/paper/2506.10947"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:58ca5ce07dcb6e054ae8b9aa5fb067d4a20d3341cf82c81e1a0234659d97678a","observation_id":"4a385ed9-c2c4-4bf4-9ed3-c95874899ef5","resolution":{"observed_at":"2026-05-16T13:37:51.109158Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:633395f4d1804d1411f46eb9346a743b785cc043ca5b432233f9e04ae39b1770","observation_id":"2dea4de5-be44-48d8-b64c-93c47805eaa6","resolution":{"observed_at":"2026-05-16T13:37:51.117231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":"2505.22660","doi":"10.48550/arxiv.2505.22660","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Maximizing confidence alone improves reasoning","venue":"ArXiv.org","work_id":"471b6786-7627-4021-a6b3-7f5cd8c83643","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:dbc9ba304bf96326bd30ce4240b412097b07033948cf28279750a4ac1b0da157","observation_id":"2a5e8549-3eef-4533-a2e1-d79e8df51518","resolution":{"observed_at":"2026-05-16T13:37:51.121149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-industry","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 979-8-89176-288-6","venue":null,"work_id":"74d89fb3-6798-4148-af6b-9764a4f36db8","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:843078ab7d32b2f185c707b7f7222352f9ac233ea77d6dd10bb8a6abebb20c2d","observation_id":"c9d64740-703c-4c47-b418-e60d75ab1a8f","resolution":{"observed_at":"2026-05-16T13:37:51.104488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.14768","doi":"10.48550/arxiv.2502.14768","metadata_source":"pith","pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","venue":"cs.CL","work_id":"b1f42628-30b7-4593-80ff-813523035c23","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:777c5b926bfc7f1953f78d1bad3dbedc4bb57e4c2ef489b34ffa8e695ea28eac","observation_id":"a1f7f2c2-4234-4f6a-ad6b-3b505e044238","resolution":{"observed_at":"2026-05-16T20:57:51.136140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:4569d107d37a4c60427f5ec32f9c992c5f140baeb53922f209ae00161c3ad7ab","observation_id":"59b052cd-f9ff-4880-9dd4-617d1ce15ab0","resolution":{"observed_at":"2026-05-16T13:37:51.113502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"clipping bias","venue":null,"work_id":"130b4a2f-5056-459a-a994-a6cae743c98a","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:8522fdf0f198b4cb2cbc680cbe481c3bcded177575e3fc071c626b2357bb54bc","observation_id":"bde87d3a-33ec-4a7e-95c3-0ba6794ae34c","resolution":{"observed_at":"2026-05-16T13:37:51.151752Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0d64a84-0150-4eeb-ae1c-5e9733b3d950","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:3e3b05aee2b9c006076ff0e4cdf9ec93a4210c46d04352c10fa4c4adf8ca3340","observation_id":"973f233d-76be-4905-85e2-892b00cd5d91","resolution":{"observed_at":"2026-05-16T13:37:51.153992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"r={r},θ= {theta}","venue":null,"work_id":"f788bd91-2d40-48f0-9170-e349fe1bb54d","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:5cf08e4d9cab5a97eb82cb797c60790132538b8cc0023062b7e5169e14047d26","observation_id":"600501ef-5d6f-4b5a-8405-621481040869","resolution":{"observed_at":"2026-05-16T13:37:51.156186Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bb43c893-dea0-4bcb-a0a3-1a80505b186a","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:25347a9b81e54b8411e2aae18a51d0fa8ad015c40f45b61d00a01c25134857b0","observation_id":"4a01737a-1ad0-401c-ab0d-6290fa19e4f9","resolution":{"observed_at":"2026-05-16T13:37:51.158345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3f0313c-cbdc-4e49-b0da-a981fe060674","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:40437bcaeb98132b49f127298d12661778e407ed24ecefe459d4c326530bda3d","observation_id":"41602f8a-22e4-4d04-b61a-fbd9a478714f","resolution":{"observed_at":"2026-05-16T13:37:51.160343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"da98d780-922f-4028-aa95-1441f2b3a0e2","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:8d452cf16fcd3d4d5e6c0146273b90b2a0c32eda2b1ffeef4fc310f7894fac6b","observation_id":"a629e801-ab4c-410a-b36b-3827bc20669b","resolution":{"observed_at":"2026-05-16T13:37:51.127702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3bd7daea-5c60-4d8d-8e19-da5f58f2dced","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:349e177fb92263f31ea6c414d65985c065a4315066c9b8e371adceb6f3888421","observation_id":"7076f53d-f1f8-474b-956c-aaddbd3892dc","resolution":{"observed_at":"2026-05-16T13:37:51.130453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"942ce1dd-dd9e-4890-a48b-324257a02a8b","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:3082ce7776fea773d42c4cd4e39d2262d32cec97d316750790a821b3434a7af0","observation_id":"da9ee582-868e-45f1-a06d-751106e9c93a","resolution":{"observed_at":"2026-05-16T13:37:51.132731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ebc88481-5906-4640-b54a-8de8fbab5a15","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:71b128c16c3a858150df66d0305cf8a00110cb73534bceb56dd54b267c1a7360","observation_id":"d5deb67a-ce15-48fa-ac4b-50ebb92cbe7d","resolution":{"observed_at":"2026-05-16T13:37:51.135158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b14b5c8e-148d-44cc-88ba-d5cc87b08f0a","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:3995dd7010e71972862e868e54347c99a8b66ce82de11cae861351688e4bdac1","observation_id":"6b536b42-0532-4243-8aa7-e0cc01c4a81a","resolution":{"observed_at":"2026-05-16T13:37:51.137643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e85d449-0f3a-4628-a33e-7ddac8d3998c","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:1a42373f5f4f50b3ad5ffc99319b8a0ba8566d11431643aaacc5a643d62a4fff","observation_id":"057e586d-008b-4832-b47e-429b76f7e8f2","resolution":{"observed_at":"2026-05-16T13:37:51.140204Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2eee1042-1971-4479-8b37-f59a86969537","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:e2e0bfc3ad75957e57100b8b87ae3348962b180ddc52b326c7573cb18ae1fef0","observation_id":"7916eca4-cbc1-4fb4-945c-9b1933db954b","resolution":{"observed_at":"2026-05-16T13:37:51.142465Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d88e066f-2b28-4e8e-bb53-68e33aef53e9","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:443ed403609e439c7ed0f9824ca85c1fd7d18791df5434bb23cd0ba63bab1d15","observation_id":"af755b84-41b2-4e3a-be8a-3ff8821da76b","resolution":{"observed_at":"2026-05-16T13:37:51.144688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e971e494-8715-4de5-bdf6-45abaabd41cf","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:d3452892c10214739997336ea94ca70364b3e3ff4ab050713eed9e4b101b84da","observation_id":"a16ecced-68fd-4e4e-8c10-7cb5b99b973e","resolution":{"observed_at":"2026-05-16T13:37:51.146842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s convert10010 to base six using Python","venue":null,"work_id":"afb7ba5d-b771-4d2b-96cd-5f126e856f30","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:70d8efe70358ff6eafa489254cdbc8ac923f0a33d5996cb09129697ad4f58d82","observation_id":"f6993bc0-5fda-48f1-99e0-57f59dacc218","resolution":{"observed_at":"2026-05-16T13:37:51.149197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":2,"unresolved":10,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 69 inbound Pith citation observations for arXiv:2506.10947."}