{"as_of":"2026-08-13T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec5db0bf9253df181206e67aa1c2e0e1a06b4e528a6ac86067e03d8c2f48d1d2","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:15.647182Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T03:13:07.963343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T03:14:31.665483Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2605.06076","last_updated":"2026-05-07T11:59:52Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:59:52Z","title":"Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T10:44:07.426652Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2605.06076"},"observation_digest":"sha256:266077ce08f2f7a9d4577a1fa8940acebdefecb8958e0df1862fee80c4f52b9c","observation_id":"e0d494e5-58fd-4ed6-9b78-1b857687d61a","resolution":{"observed_at":"2026-06-26T01:15:16.925411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2605.30451","last_updated":"2026-05-28T18:20:32Z","snapshot_observed_at":"2026-08-12T12:15:34.611388Z","submitted_at":"2026-05-28T18:20:32Z","title":"VeriGate: Verifier-Gated Step-Level Supervision for GRPO","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:47:45.666708Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2605.30451"},"observation_digest":"sha256:e4922dbbe551c270a2024531dc0abd08f31fc65e72fa89449c9e9a5e7dca8c49","observation_id":"ae66e80a-5c2d-4298-9785-9922735cc5a2","resolution":{"observed_at":"2026-06-29T08:53:16.058852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2606.22043","last_updated":"2026-06-20T13:48:19Z","snapshot_observed_at":"2026-08-10T08:54:14.180931Z","submitted_at":"2026-06-20T13:48:19Z","title":"When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:17.464276Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2606.22043"},"observation_digest":"sha256:a6e2aa0c7985a36abd89bc7f5b85b52280cab90fccfc86a4b20303b542c58e67","observation_id":"a07b929c-f40f-4b06-971a-0eb8ac7915e9","resolution":{"observed_at":"2026-07-04T08:29:41.280184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2606.30789","last_updated":"2026-07-01T14:28:25Z","snapshot_observed_at":"2026-08-03T01:34:16.719337Z","submitted_at":"2026-06-29T18:19:09Z","title":"Predictable GRPO: A Closed-Form Model of Training Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:40:47.911021Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2606.30789"},"observation_digest":"sha256:3f9a107d1e196774923f01abc9d64b8c4f718f5ef5c26a6cd0145b2bf4b68191","observation_id":"69d96bbf-4951-4da1-bd98-967b9b092f60","resolution":{"observed_at":"2026-07-01T06:45:29.599112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2606.30789","last_updated":"2026-07-01T14:28:25Z","snapshot_observed_at":"2026-08-03T01:34:16.719337Z","submitted_at":"2026-06-29T18:19:09Z","title":"Predictable GRPO: A Closed-Form Model of Training Dynamics","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T20:26:15.667646Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2606.30789"},"observation_digest":"sha256:e1bc8ce97949975d75c3c3cd6856e03f7af50193992009721453a9c2c9313730","observation_id":"c26c71ef-6c1b-40f6-9249-eeac1be6c1fb","resolution":{"observed_at":"2026-07-02T20:27:21.698716Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"cited_work":{"arxiv_id":"2601.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11061","snapshot_observed_at":"2026-07-08T03:14:31.665483Z","title":"Spurious rewards paradox: Mechanistically understanding how rlvr activates memorization shortcuts in llms","venue":"cs.LG","work_id":"5b09c529-8db2-4628-af56-56fb40bd3267","year":2026},"citing_paper":{"arxiv_id":"2607.06522","last_updated":"2026-07-07T17:27:59Z","snapshot_observed_at":"2026-08-02T11:32:48.615721Z","submitted_at":"2026-07-07T17:27:59Z","title":"Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T03:13:07.963343Z"},"links":{"cited_paper":"/paper/2601.11061","citing_paper":"/paper/2607.06522"},"observation_digest":"sha256:d0a016c2b841b217b50d40cb4e8fb06480f038b4d3a662ea1c1d26dbecc2f015","observation_id":"88b68295-3d5f-44fa-a4ac-f7208502a78d","resolution":{"observed_at":"2026-07-08T03:14:31.666850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.11061/citation-record","integrity":"/paper/2601.11061/integrity","json":"/paper/2601.11061/citation-record.json","paper":"/paper/2601.11061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:14.280726Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.280726Z"},"links":{"citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:0f392f5a23a0e6b25043b09607e21a445e2ddcb6b35aa3e253e6a436a1c01dc9","observation_id":"8f5a0e18-e609-4c03-8bcd-d7415847e76a","resolution":{"observed_at":"2026-08-03T10:13:14.280726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T10:13:14.452071Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.452071Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:919ada79b2c4b5f8b6f85383930eb64af3fa2219e0ecc3a0d20aad6508222129","observation_id":"d77764c6-16dc-4013-baae-24893b47c2f9","resolution":{"observed_at":"2026-08-03T10:13:14.452071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:14.523326Z","title":"The reasoning-memorization interplay in language models is mediated by a single direction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.523326Z"},"links":{"citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:11966484b50dc0e7f5986d1b06eff8997c009ee5c556603df9638c0920997bcc","observation_id":"0b09f264-9685-4506-981d-1900be54018f","resolution":{"observed_at":"2026-08-03T10:13:14.523326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01380","last_updated":"2025-03-12T04:17:41Z","snapshot_observed_at":"2026-08-12T22:32:43.412084Z","submitted_at":"2024-10-02T09:49:45Z","title":"Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01380","snapshot_observed_at":"2026-08-03T10:13:14.630860Z","title":"Knowledge entropy decay dur- ing language model pretraining hinders new knowledge acquisition.arXiv preprint arXiv:2410.01380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.630860Z"},"links":{"cited_paper":"/paper/2410.01380","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:6c2c6044ae1a91e71d5d43f8f59d32f717e5ddfde065400161ef980fbcaa5b77","observation_id":"ed9ed0df-d29b-4f28-be89-c8d8198ed734","resolution":{"observed_at":"2026-08-03T10:13:14.630860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00088","last_updated":"2025-05-30T06:19:49Z","snapshot_observed_at":"2026-08-13T08:56:09.524139Z","submitted_at":"2025-05-30T06:19:49Z","title":"HD-NDEs: Neural Differential Equations for Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00088","snapshot_observed_at":"2026-08-03T10:13:14.814920Z","title":"Hd-ndes: Neural differential equa- tions for hallucination detection in llms.arXiv preprint arXiv:2506.00088, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.814920Z"},"links":{"cited_paper":"/paper/2506.00088","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:96c361a9660beedecf92822f6579c472b1a2f2169dc69cf899988a74f5e792fd","observation_id":"fdf2b441-794e-4350-bc82-1d0146fe3a2f","resolution":{"observed_at":"2026-08-03T10:13:14.814920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02762","last_updated":"2019-06-06T18:10:08Z","snapshot_observed_at":"2026-08-03T04:24:07.412786Z","submitted_at":"2019-06-06T18:10:08Z","title":"Understanding and Improving Transformer From a Multi-Particle Dynamic System Point of View","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02762","snapshot_observed_at":"2026-08-03T10:13:14.951041Z","title":"Understanding and improving transformer from a multi-particle dynamic system point of view.arXiv preprint arXiv:1906.02762,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.951041Z"},"links":{"cited_paper":"/paper/1906.02762","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:1d77f5844a1b1ec755f658ad62c3a28497cc96da1a130d1ed348b859f3423310","observation_id":"0ffc9584-3a50-421c-9018-91003611e43e","resolution":{"observed_at":"2026-08-03T10:13:14.951041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-03T10:13:15.145479Z","title":"org/abs/2501.00656","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.145479Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:b1cd502d4725c39a440e6bba2e96391f739373fadec08118c0e1267cf9fc84c1","observation_id":"d3ae321a-ec46-4c73-a723-a87ea545fefd","resolution":{"observed_at":"2026-08-03T10:13:15.145479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-10T11:02:14.031196Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-03T10:13:15.212310Z","title":"S., Xin, R., Geng, S., Wang, Y ., Oh, S., Du, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.212310Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:a63e82435f7111b3f44b7862c509695ca6f005759ef8168b1e007347df455817","observation_id":"b03b36f4-d86f-4452-be41-ff46f16d8cf7","resolution":{"observed_at":"2026-08-03T10:13:15.212310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01014","last_updated":"2024-12-02T00:17:43Z","snapshot_observed_at":"2026-08-13T04:07:59.109249Z","submitted_at":"2024-12-02T00:17:43Z","title":"Detecting Memorization in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01014","snapshot_observed_at":"2026-08-03T10:13:15.310993Z","title":"Detecting memorization in large language mod- els.arXiv preprint arXiv:2412.01014,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.310993Z"},"links":{"cited_paper":"/paper/2412.01014","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:3c91252e46a709a6213e4399859aec3147c409263b9ddf5b3a414aa4a6e49202","observation_id":"7db093bf-05df-4210-883f-92377ccec7e2","resolution":{"observed_at":"2026-08-03T10:13:15.310993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-09T18:15:22.003522Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21188","snapshot_observed_at":"2026-08-03T10:13:15.414661Z","title":"Mirage or method? how model-task alignment induces divergent rl conclu- sions.arXiv preprint arXiv:2508.21188, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.414661Z"},"links":{"cited_paper":"/paper/2508.21188","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:a4fde7ff8f1ac455b583f1ee598ed83256e19da1ff20789f9f50f0382836783e","observation_id":"efa8a444-62f3-40aa-86a1-443620487913","resolution":{"observed_at":"2026-08-03T10:13:15.414661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T10:13:15.553819Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.553819Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:97990807227b527bd1dd8c6a4710bc96b878ae89d2ff47afdf6679d6ac663718","observation_id":"a6a6d943-7412-49b1-8e8d-079f10e2ebf3","resolution":{"observed_at":"2026-08-03T10:13:15.553819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-03T10:13:15.647182Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.647182Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:b61ab59afd011d54a738220e066b025ddf29e27bd94eb51b357031cd365c5d76","observation_id":"6dde6f1f-5748-492b-baf2-b2d3e2dd3021","resolution":{"observed_at":"2026-08-03T10:13:15.647182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14989","last_updated":"2026-06-30T21:11:29Z","snapshot_observed_at":"2026-08-13T04:12:30.767642Z","submitted_at":"2024-02-22T22:00:03Z","title":"Stable Neural Stochastic Differential Equations in Analyzing Irregular Time Series Data","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14989","snapshot_observed_at":"2026-08-03T10:13:15.021174Z","title":"Oh, Y ., Lim, D.-Y ., and Kim, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.021174Z"},"links":{"cited_paper":"/paper/2402.14989","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:4b51a35780e455f5334b0f669811315caa825ae8c966c1af7e0d5c4d2e4c43e0","observation_id":"838803a9-c6a6-48c2-9e49-9783e1b17d8c","resolution":{"observed_at":"2026-08-03T10:13:15.021174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:14.386551Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.386551Z"},"links":{"citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:dfbfff7fb85ec24b1e9a3902c297a4c8b3e355ecd24cdd313e6ea1370227080b","observation_id":"133578b5-d394-491b-b751-3cfc492c3836","resolution":{"observed_at":"2026-08-03T10:13:14.386551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-12T17:03:44.244933Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-03T10:13:14.751527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.751527Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:01a5f0bfc47ae8b265b9768b6e3767485297e34e4feae880509521f0aa182033","observation_id":"4a88acd3-be15-493f-a424-bfa82670cc09","resolution":{"observed_at":"2026-08-03T10:13:14.751527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-11T13:20:39.179630Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-03T10:13:14.881237Z","title":"Are your llms capable of stable reasoning?arXiv preprint arXiv:2412.13147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.881237Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:66b70cc70556747499914a97587b5f47bbc6ca90fa1052e8be7d7b3bf0140238","observation_id":"746873b4-bf13-44b4-8e96-bf83f4bce58d","resolution":{"observed_at":"2026-08-03T10:13:14.881237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-03T10:13:14.699803Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.699803Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:f15c169a4e636ea423aee9a034efb5a7cd7e5f78f450b04b0eb6e37ca12eadbd","observation_id":"81bd8425-f569-4e5f-af51-1dac109baa92","resolution":{"observed_at":"2026-08-03T10:13:14.699803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:14.325731Z","title":"Exploration vs exploitation: Rethinking rlvr through clipping, entropy, and spurious reward.arXiv preprint arXiv:2512.16912,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:14.325731Z"},"links":{"citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:1f7be2ed98a1f5a5e8bada30aceeeff062898727459ec62606471fbe7113d723","observation_id":"fea7e4e0-acbc-4464-9978-08e8b41d89d6","resolution":{"observed_at":"2026-08-03T10:13:14.325731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 6 inbound Pith citation observations for arXiv:2601.11061."}