{"as_of":"2026-08-05T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d368a2736dd9c8814b6f5718b8719a7960dcf27e2a265d0f3e4d128878de4f01","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T10:31:04.728005Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":71,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:22:11.790955Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:25:57.840663Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:f77ed846fdc1476163e2ed99034c006a4dac40325fca5fe6297ec9886da39efb","observation_id":"47bbb0d6-6ebb-4c6e-a885-d781984ddf9a","resolution":{"observed_at":"2026-05-19T06:59:03.404797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-04T22:56:02.509530Z","title":"Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.06948","last_updated":"2026-05-30T09:01:09Z","snapshot_observed_at":"2026-08-04T22:56:01.963927Z","submitted_at":"2025-09-08T17:58:02Z","title":"Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:56:02.509530Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2509.06948"},"observation_digest":"sha256:428e75d3de3bb9f913977877878fbaa94824c7d0ed85a06119f937a1d985e4c0","observation_id":"058bade5-4ca3-4d40-aae4-2ec52444afe0","resolution":{"observed_at":"2026-08-04T22:56:02.509530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:830c673a671627105628547b1284d12f97a8851e732fe20b4ee802f3028c4dd5","observation_id":"a60124cb-8aa4-426d-9994-f1153aa919bd","resolution":{"observed_at":"2026-05-18T00:05:31.546896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-04T12:52:26.866176Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01833","last_updated":"2026-05-25T18:23:42Z","snapshot_observed_at":"2026-08-04T12:52:24.589866Z","submitted_at":"2025-10-02T09:28:13Z","title":"Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:52:26.866176Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2510.01833"},"observation_digest":"sha256:8ba107eaab406df2d8fd3094eba9fda35f847a9070a244ef860ed8b168387ef3","observation_id":"723679c4-7e2d-4f29-aa74-cb04aaf5aadf","resolution":{"observed_at":"2026-08-04T12:52:26.866176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-04T11:17:47.562551Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05969","last_updated":"2026-07-19T06:24:18Z","snapshot_observed_at":"2026-08-04T11:17:42.650330Z","submitted_at":"2025-10-07T14:24:32Z","title":"Probing the Difficulty Perception Mechanism of Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:17:47.562551Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2510.05969"},"observation_digest":"sha256:9a87332198025dd88f0efb0018c229481018a4e1c3101461d38a8a1bed51b548","observation_id":"efedbebc-b4da-49ff-8023-bf8b809b4272","resolution":{"observed_at":"2026-08-04T11:17:47.562551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-04T07:37:16.657252Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.25065","last_updated":"2026-05-24T05:29:01Z","snapshot_observed_at":"2026-08-04T07:37:14.310992Z","submitted_at":"2025-10-29T01:07:45Z","title":"Rewarding Structural Conformance of Reasoning using Process Mining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:16.657252Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2510.25065"},"observation_digest":"sha256:969b87705b5ccb19a69acde2a22da89ceb8e017f9aab25c8f3dbb85794ebf1c8","observation_id":"967a59f4-c332-409d-a416-48d6fa20ece1","resolution":{"observed_at":"2026-08-04T07:37:16.657252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-03T23:08:05.560042Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.560042Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:7e72d5da842ad069f9bad2673c86cb3f1ff77c6ab3c4e909c22824f3976bf38c","observation_id":"7eff8bab-4ce0-4f8b-b813-c430af938f21","resolution":{"observed_at":"2026-08-03T23:08:05.560042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2511.20814","last_updated":"2026-04-05T23:59:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T20:00:47Z","title":"SPHINX: A Synthetic Environment for Visual Perception and Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T04:19:26.808804Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2511.20814"},"observation_digest":"sha256:50b08ee844ecc6c68ae93f1e189b437cff8a336678b3e021c8cf3b6b23e10fde","observation_id":"5e0f3afa-9e22-4072-a047-c2e47d2f7927","resolution":{"observed_at":"2026-05-17T04:21:30.768641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2601.04809","last_updated":"2026-05-04T13:55:24Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T10:42:04Z","title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T16:24:04.132572Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2601.04809"},"observation_digest":"sha256:9ba757dc96221a680b92cfb775ec087376892596d89380ad6e311f258fbc4eac","observation_id":"c73c02c1-8d22-4ee2-bebf-4d4972f38c20","resolution":{"observed_at":"2026-05-16T16:28:05.679417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2601.21464","last_updated":"2026-05-07T16:58:04Z","snapshot_observed_at":"2026-07-31T17:41:41.271363Z","submitted_at":"2026-01-29T09:41:14Z","title":"Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T10:04:44.379128Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2601.21464"},"observation_digest":"sha256:0cf395dc2900ce54482273f5aee2137bf3d2e767d52e1652d000aa4181e43e7b","observation_id":"df99729a-bc3a-4ae8-9baa-f3fa3296fdb8","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2601.21619","last_updated":"2026-05-09T01:57:30Z","snapshot_observed_at":"2026-07-06T22:43:30.761426Z","submitted_at":"2026-01-29T12:22:45Z","title":"On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:38:09.875786Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2601.21619"},"observation_digest":"sha256:643716e741cf3b3952ff3f9fe91507571fc33723bfb1af8aa795dda6d70351ef","observation_id":"cf38665a-e33a-400c-b7a5-84870c2e7f42","resolution":{"observed_at":"2026-05-16T10:40:51.353235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-02T21:05:25.136603Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:25.136603Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:32ba3ac86ed645c92392d3e8ced0a9065d8e3bc095ffdebdf7e2f38025a84c62","observation_id":"860ebc19-c46d-4c0c-8fb0-6d1bd6a6f7f8","resolution":{"observed_at":"2026-08-02T21:05:25.136603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-02T20:44:44.881935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22642","last_updated":"2026-06-18T19:10:56Z","snapshot_observed_at":"2026-08-04T14:01:22.477463Z","submitted_at":"2026-02-26T05:47:30Z","title":"Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:44:44.881935Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2602.22642"},"observation_digest":"sha256:e7b526fa1fdf8c8ddb5c992af907e1368ba2a2f8235c8d04c90a02145320e785","observation_id":"f9d9e73e-2c42-43b6-88a5-c55fc99f6445","resolution":{"observed_at":"2026-08-02T20:44:44.881935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.10827","last_updated":"2026-04-12T21:49:13Z","snapshot_observed_at":"2026-07-06T22:59:23.126963Z","submitted_at":"2026-04-12T21:49:13Z","title":"Your Model Diversity, Not Method, Determines Reasoning Strategy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:30.448400Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.10827"},"observation_digest":"sha256:24f8316b11f479a16506332ab8cef34db705f338e038832110f1fa2aa9ed840d","observation_id":"690dc376-9abc-4168-8dd7-8c8e5a7cf793","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:6cc2e7d052b6cf0d1e84d5f6118811d88b30d5228c2a47ffc3e521253fd54852","observation_id":"07c5dbba-d228-4d05-aeae-fa4ae0032d28","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.17328","last_updated":"2026-05-23T14:02:35Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T08:48:46Z","title":"Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T06:23:14.905706Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.17328"},"observation_digest":"sha256:268f4d2200831b7a9ae649c34d3d5b726b8e116b7b5624bb60becbc122fc9a52","observation_id":"c4d001c6-05c1-4863-a9cb-572442a58a36","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.18381","last_updated":"2026-04-20T15:04:57Z","snapshot_observed_at":"2026-08-02T10:52:14.752020Z","submitted_at":"2026-04-20T15:04:57Z","title":"Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T04:55:18.468593Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.18381"},"observation_digest":"sha256:3751f88851dca658d40d771e9893b74d75d438807f35e9055ec7e5ac77992384","observation_id":"94fced4b-444c-4351-a118-0b4e0b12381f","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0b4fd1ffe94502a461e1d6ea112e4823a42c3ba6dd85b5395833b73cb3b91997","observation_id":"0d3b114b-7072-4f2c-83fe-8eb9bab0386a","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-07T10:42:27.644514Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:67c7bf4323e7a5a4d6cd3913be8701bf6bf9cf20af90ae78187bcda44a68b65f","observation_id":"8997fca0-e118-4973-a178-c56d88e2a3c4","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-02T15:28:11.698960Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T15:28:11.698960Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:2016a23f1afd077aabfa047588afee585c8c64cf4cb612c6b16b8f54f4a15590","observation_id":"3e7b28f8-4b77-43c5-b8f0-cb93f6526045","resolution":{"observed_at":"2026-08-02T15:28:11.698960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:90a902e22b86383a9417ab2b595f0a35d65e791fcf3c5346f211f0bd814f4524","observation_id":"84e34f6c-4458-468d-9d27-fca1959a941f","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T12:57:24.822525Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.06387"},"observation_digest":"sha256:e672f8827148489076081fccb20fe56bef1285ef92714e98a2533415c2dca692","observation_id":"bfebc584-9595-40c8-a585-a60125dd2e88","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T01:51:29.021423Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.06387"},"observation_digest":"sha256:6e26947d7f1df038a03ac85cea8feb32409ed98f09d826e6b40281cb34511c75","observation_id":"32a3b2f2-5629-4d01-ab47-dc53fee74265","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-14T21:14:22.718769Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.06387"},"observation_digest":"sha256:52656cc5b5d6370441a5f9a530eb69d662ce6cf50521c10160bc9cecfda80333","observation_id":"0515b3fd-630d-4969-bf5d-2338303bdbb1","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.06523","last_updated":"2026-05-07T16:30:28Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T16:30:28Z","title":"On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:53.063991Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.06523"},"observation_digest":"sha256:6dfb498c043d06d9002478377618b2b2178611ae194189c35d0249808109ddc0","observation_id":"efa33de1-b97f-4433-a238-25112f42335b","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:4ae82ecb67efe1aeedd1fbe99aa0790f103726e6b3228a5cdab82bd88106dc20","observation_id":"685b4bac-0184-4bf8-99b8-1ceab8937d93","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:5a7af5c2bcd1eafdf60a8525f5fdbe2a0b6ab0cb14791ea1824ca68d2448d6df","observation_id":"47286ca3-2199-4373-9bf6-b33efca7cdb3","resolution":{"observed_at":"2026-05-19T18:07:42.397935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:4378ca3012a73d8e980947caaea9bc7401ba31c936f64fb5ab2b3678206bf986","observation_id":"b35cf74e-1a9d-4ee5-ada3-20189188e3c4","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08741","last_updated":"2026-05-09T07:06:37Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:06:37Z","title":"Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:22.454987Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08741"},"observation_digest":"sha256:3eae5099d6244e8a93460abca44c2191fbe37820c2e2afcac4bf1f26b51b6825","observation_id":"894a6985-5629-4100-99a9-42a827d32dfa","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08905","last_updated":"2026-05-09T11:57:25Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T11:57:25Z","title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T02:44:33.143247Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08905"},"observation_digest":"sha256:bd26db0223c2914bd51fa2258b0099a009d2aa02bb968ff3e760e78976bc8d41","observation_id":"7472f34e-0af5-472c-885f-591472bf5d2a","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:4598857afd50c0a8508459322087f0a0837dc6d9934c1702a76fca2379d90364","observation_id":"22d33486-cbbf-4c6a-95c9-20ae25de4097","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.11625","last_updated":"2026-05-12T06:51:31Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:51:31Z","title":"Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:21.377700Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.11625"},"observation_digest":"sha256:cde28956ea8b3269a97642c6622656eda882e151d438903046aeecc6ea374b62","observation_id":"e0eb2663-a354-47ec-91a2-097eb8ad1ec1","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.11739","last_updated":"2026-05-21T08:50:47Z","snapshot_observed_at":"2026-08-02T09:40:14.018328Z","submitted_at":"2026-05-12T08:19:15Z","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T10:10:14.565995Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.11739"},"observation_digest":"sha256:fd6d9a8d1cf597af873357cfd97f2ffa6bf589cbf4cff775254d2ea3e390b7e4","observation_id":"63e4046a-1b0f-43a9-99ce-44fb76fbc868","resolution":{"observed_at":"2026-05-22T10:11:22.765572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.12492","last_updated":"2026-05-12T17:59:34Z","snapshot_observed_at":"2026-07-31T18:31:37.222688Z","submitted_at":"2026-05-12T17:59:34Z","title":"Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T04:53:52.898843Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.12492"},"observation_digest":"sha256:a1de303b3f2539c2e95124470da9a9ff3ca8401b654276aa2f9d7e2d8f728256","observation_id":"23eeed74-71e7-412f-b5eb-958a2afb8867","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-04T16:10:21.909941Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:556ba166396b4d55ee79557ba2e8aca579f3190ae6b0a309972a4e221875ebd1","observation_id":"ad9b5f8d-ce88-4956-b600-102f09a6f772","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:b362207e8e1776433c1787182b97624f9eeab62d49f393c22bebae405d42861c","observation_id":"550971ca-a461-4aae-96f8-1821c3e2c580","resolution":{"observed_at":"2026-05-20T06:43:05.906903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:ab12ac6c119ec80c76c9d89fdde72a46bd95a104dacaef9b2b4556a702416a79","observation_id":"e4b2e5c6-750a-41d0-b97e-86ef77a03cc4","resolution":{"observed_at":"2026-05-20T05:33:04.086260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.20369","last_updated":"2026-05-19T18:18:59Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T18:18:59Z","title":"DEL: Digit Entropy Loss for Numerical Learning of Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T07:35:22.992256Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.20369"},"observation_digest":"sha256:b90627f005c7e568b2d52731dfdb85416e00d7a333508024151d155a10817974","observation_id":"971dcc5f-8264-42b0-8b6c-464b61374a60","resolution":{"observed_at":"2026-05-21T07:39:49.460219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.21467","last_updated":"2026-05-20T17:53:09Z","snapshot_observed_at":"2026-08-02T18:02:44.990875Z","submitted_at":"2026-05-20T17:53:09Z","title":"DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-21T05:24:46.545570Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.21467"},"observation_digest":"sha256:599b5a191dfb955c1df4c4e63cf5c05ddbd54bc369a6740646524a1938572b5b","observation_id":"bd7ea9ff-da6f-420d-bdd9-6ee31bad6352","resolution":{"observed_at":"2026-05-21T05:29:40.132496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:812bda1fdd9a70f6b3d89428944e4dced70196ef83b1c5f5dc69d6027fb58432","observation_id":"8bb3ca51-c57b-4648-895e-466727ea8ea2","resolution":{"observed_at":"2026-05-22T06:21:10.412848Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.25381","last_updated":"2026-05-25T03:10:51Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T03:10:51Z","title":"Not only where, But when: Temporal Scheduling for RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:34:44.791173Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.25381"},"observation_digest":"sha256:3933a89aae3a23c61db2d593b489043aab05b9b77eebd60959400f10d0e548d9","observation_id":"e880cc08-4db1-45fc-9a62-cd7c46fb811b","resolution":{"observed_at":"2026-06-29T22:44:01.863471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:63c9f1cfbb3ffbd0ee3021003616859df6053b77258687e1c9ea8520d6ddb439","observation_id":"ea838eab-8e97-476f-8d80-a2736669e7f2","resolution":{"observed_at":"2026-06-29T19:53:55.807818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T19:34:12.081362Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.26971"},"observation_digest":"sha256:a51bf71a52a6a8d638a3203b44f18a11e0bd9e49f444e2e501c1f12622a3c9eb","observation_id":"bda730de-94b9-4c7c-8f93-9450c7624124","resolution":{"observed_at":"2026-06-29T19:43:55.115046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-02T23:18:00.565585Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T11:51:01.769882Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:830ae2d74c681774876f6a0adfa1f70a8c7f9ee53ea7cc4735d41e28c2ac3c76","observation_id":"9bee5b38-0f96-4678-a3e3-9faac621eb5c","resolution":{"observed_at":"2026-06-29T11:53:23.707364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-02T12:58:10.897147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28421","last_updated":"2026-07-30T08:43:29Z","snapshot_observed_at":"2026-08-02T23:18:00.565585Z","submitted_at":"2026-05-27T12:52:58Z","title":"DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:58:10.897147Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.28421"},"observation_digest":"sha256:1d4108661217ff16b02f73d5d9edbe43ec5c5364017bcfa809bca0e15627264a","observation_id":"d7258fbd-1837-4aa7-8859-85c5e3b47204","resolution":{"observed_at":"2026-08-02T12:58:10.897147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":287,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:cd46816c941f46b66d3c65b9eeda51091f62897261cc639b30200127eda2805e","observation_id":"a769edab-07f2-4b0d-9d8a-e2a919c54835","resolution":{"observed_at":"2026-07-01T20:56:13.352648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.02684","last_updated":"2026-06-04T15:52:50Z","snapshot_observed_at":"2026-07-06T23:43:02.654629Z","submitted_at":"2026-06-01T17:58:22Z","title":"Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T15:14:42.489647Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.02684"},"observation_digest":"sha256:65019c89ec7cb2090d1eec173d0720e455e1f8ff768d2c0d21696eed5335e4e4","observation_id":"a757bd81-2922-43b1-bea3-55363c01d36a","resolution":{"observed_at":"2026-07-01T22:36:17.403843Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:6694437e2d1ccd02da355c3a12563d7fec06594af03bb3a7c0887bec78a66391","observation_id":"7fb7b005-ff50-4cc2-a597-31b394148e56","resolution":{"observed_at":"2026-07-02T03:26:28.773294Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:241d43fe245e29a6a82895f9be5899439baec0e87db116179eb02c430b4b7689","observation_id":"c980f253-16a5-419b-9818-56453ac27ce8","resolution":{"observed_at":"2026-07-02T06:06:40.776163Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.04889","last_updated":"2026-06-03T13:51:27Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T13:51:27Z","title":"GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T05:59:00.005336Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.04889"},"observation_digest":"sha256:df8ab13e72a0bf60c7249a38d3d54bc39c74386321b8e548da2910879bc679d7","observation_id":"9a80c423-7e11-43b9-8251-bb8b81bd5859","resolution":{"observed_at":"2026-07-02T08:36:47.619392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.05201","last_updated":"2026-05-22T17:05:31Z","snapshot_observed_at":"2026-07-06T23:45:11.627867Z","submitted_at":"2026-05-22T17:05:31Z","title":"State commitment learning: training language models to distinguish computation from memory","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T15:21:49.337222Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.05201"},"observation_digest":"sha256:435ef9e6736c14e38ede939a983a7c6e9151a8a35dcb5d1778bc6ef4a884380b","observation_id":"b425e865-08fb-4d09-aafc-324d5546c6da","resolution":{"observed_at":"2026-06-30T15:24:49.920750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-07-06T23:47:38.671681Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:d34eb62127af5836e1db721f6899013585fbfc9f901faf45bac8a850e3214775","observation_id":"457f3a84-162b-4381-8e5e-f7a65fda66f9","resolution":{"observed_at":"2026-07-02T21:07:23.905688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.09304","last_updated":"2026-06-08T10:11:58Z","snapshot_observed_at":"2026-08-01T14:37:58.992350Z","submitted_at":"2026-06-08T10:11:58Z","title":"SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:37:23.465811Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.09304"},"observation_digest":"sha256:85066551050bc49608949625fec65c8df3f616f85f4e6273887979b4c41cd120","observation_id":"8249fa7b-1492-4cc3-a41a-584ac4c82c17","resolution":{"observed_at":"2026-07-03T01:17:31.317061Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:28:18.490452Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.11709"},"observation_digest":"sha256:d2a731cca094856bf8dabeb7ee1499e0f90aff3b42c9a5880dbfa6e75e986375","observation_id":"8c83603f-2553-43f7-9c8a-8d0ba9286330","resolution":{"observed_at":"2026-07-03T09:07:48.370451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.17735","last_updated":"2026-06-16T09:55:45Z","snapshot_observed_at":"2026-08-01T22:37:07.638778Z","submitted_at":"2026-06-16T09:55:45Z","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T00:48:56.892634Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.17735"},"observation_digest":"sha256:74cd1fee2280adafb5453f4a8e247b38b671583587f148ab0c7a8f583b8b389a","observation_id":"365dd4e4-44fb-4a6a-980e-69e8631d0689","resolution":{"observed_at":"2026-07-03T21:18:58.389882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.22830","last_updated":"2026-06-22T04:13:14Z","snapshot_observed_at":"2026-07-31T08:37:13.007154Z","submitted_at":"2026-06-22T04:13:14Z","title":"Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T08:49:58.735297Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.22830"},"observation_digest":"sha256:28d926c13d595f0dd42612a75f4bdc652638f7a734a9f8a4e553d98374f6a055","observation_id":"74c5ef6d-7dda-442c-b49a-f823e2885d23","resolution":{"observed_at":"2026-07-04T10:29:44.952266Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.24143","last_updated":"2026-06-23T04:50:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-23T04:50:49Z","title":"AsyncOPD: How Stale Can On-Policy Distillation Be?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:40:57.112748Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.24143"},"observation_digest":"sha256:0a1335c55648ab077234fc177db20b56875f372ace077322eb37ec6295326b2f","observation_id":"1cc6cde3-6c36-4222-87cd-4a0aa0896f7b","resolution":{"observed_at":"2026-07-04T16:29:56.821408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.29424","last_updated":"2026-06-28T14:39:06Z","snapshot_observed_at":"2026-08-02T07:55:28.979451Z","submitted_at":"2026-06-28T14:39:06Z","title":"EntroRouter: Learning Efficient Model Routing via Entropy Regulation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-30T07:42:35.962864Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.29424"},"observation_digest":"sha256:9f83a9f09c0f04d0c0cf742954c50a9eec833e0bd277b107e221dcad8e5bd77a","observation_id":"2832645c-535e-4fe9-8480-08a3aa464086","resolution":{"observed_at":"2026-06-30T07:44:21.623493Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.29526","last_updated":"2026-06-28T17:40:02Z","snapshot_observed_at":"2026-08-02T15:21:00.457548Z","submitted_at":"2026-06-28T17:40:02Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T07:23:19.403334Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.29526"},"observation_digest":"sha256:2dcd1043dd3e8f9f0a47d6edc174e5ac1b91f9dd22eb32aa40ddcb672cf0c6fa","observation_id":"ea29cd36-3041-4a6c-aa58-ad151fe1e294","resolution":{"observed_at":"2026-06-30T07:24:20.891805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.31002","last_updated":"2026-06-30T00:27:53Z","snapshot_observed_at":"2026-08-01T10:19:09.703226Z","submitted_at":"2026-06-30T00:27:53Z","title":"Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T00:58:00.053021Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.31002"},"observation_digest":"sha256:28aa9fc33196343dd3e86ea453c9c8acaa01e04572b1348a5a012dae7eae8159","observation_id":"0cd46127-b12a-4cf3-9c6a-f76ce529268f","resolution":{"observed_at":"2026-07-01T13:15:45.431035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-11T20:01:06.623978Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifi- able Mathematical Dataset for Advancing Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04332","last_updated":"2026-07-05T14:29:18Z","snapshot_observed_at":"2026-08-02T21:22:21.546078Z","submitted_at":"2026-07-05T14:29:18Z","title":"On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T20:01:06.623978Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.04332"},"observation_digest":"sha256:664f94d5e4a9a5388c45fe318039cf17c322c47380715084f8acd06f8689fc56","observation_id":"f640058f-4066-40c0-b8b7-8541b8dd9730","resolution":{"observed_at":"2026-07-11T20:01:06.623978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:bb5c5b23799050e2629d8f05b70e5ddd8efc1a4020c3bca9a3313b48ffcdeaa1","observation_id":"78c2130d-9121-4dd8-9f88-afced1b0401f","resolution":{"observed_at":"2026-07-07T12:33:45.202425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:4bd2ba1133cbeeef1fae690a21c29e8dee71de3c3fbdc67788ef692f198076ed","observation_id":"6cf49e12-3bfb-4301-9504-f6cef34cf187","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2607.07674","last_updated":"2026-07-08T17:32:58Z","snapshot_observed_at":"2026-07-11T23:20:19.781757Z","submitted_at":"2026-07-08T17:32:58Z","title":"Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T03:20:40.229376Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.07674"},"observation_digest":"sha256:6a4df3e8479ceaeedb4ecff566bacb67e49265308570ad672b182da9d063cf7f","observation_id":"2dea5867-8b5f-49dc-9414-306428d24929","resolution":{"observed_at":"2026-07-09T03:25:57.841864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2607.07690","last_updated":"2026-07-08T17:49:14Z","snapshot_observed_at":"2026-08-03T14:09:50.236027Z","submitted_at":"2026-07-08T17:49:14Z","title":"Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T02:29:12.366018Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.07690"},"observation_digest":"sha256:808568d3c0fede8098b342bba41e9378e409f887a51f28798ba034b9650d5e86","observation_id":"8b390d5b-bf7a-42a2-b48e-ce75570111dc","resolution":{"observed_at":"2026-07-09T02:35:53.868114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-14T05:09:00.865375Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11505","last_updated":"2026-07-13T12:56:21Z","snapshot_observed_at":"2026-07-16T23:19:50.527720Z","submitted_at":"2026-07-13T12:56:21Z","title":"Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:09:00.865375Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.11505"},"observation_digest":"sha256:8e78c71624f13f4713fae32eea328520f4c7ef10d9cc065ca947c30b24097dd1","observation_id":"8c12d294-4409-4f4e-a72f-2f576ca10288","resolution":{"observed_at":"2026-07-14T05:09:00.865375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T05:09:58.972025Z","title":"DeepMath-103K: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22334","last_updated":"2026-07-24T14:12:54Z","snapshot_observed_at":"2026-08-01T05:09:51.474379Z","submitted_at":"2026-07-24T14:12:54Z","title":"Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T05:09:58.972025Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.22334"},"observation_digest":"sha256:d9ec9ba7538b2bd2c6006ff33188c31c09ce1d40a1264e59b3e6495f7cd6c398","observation_id":"3b5f5768-87a2-432a-88c7-92682d12d1ef","resolution":{"observed_at":"2026-08-01T05:09:58.972025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T00:26:24.869605Z","title":"arXiv preprint arXiv:2504.11456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-03T10:50:56.850549Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T00:26:24.869605Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.26246"},"observation_digest":"sha256:3ab876574070221ceb76bf8f4da4932c9e1fb1bbdbe489dc4e5e2aaa1212926c","observation_id":"3c36225b-6de3-4a63-8363-09d4bb8883ad","resolution":{"observed_at":"2026-08-01T00:26:24.869605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-01T01:28:56.250910Z","title":"arXiv preprint arXiv:2504.11456 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-02T23:42:38.200651Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.250910Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:14e8505cb2dbfa75f91d864b7920a4637ed38a83b61f70f308a22ad63d7f3c91","observation_id":"72fd49f8-e1e1-40ae-961e-20159b36095b","resolution":{"observed_at":"2026-08-01T01:28:56.250910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-03T00:54:34.691461Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28642","last_updated":"2026-05-26T02:25:09Z","snapshot_observed_at":"2026-08-05T02:11:28.386421Z","submitted_at":"2026-05-26T02:25:09Z","title":"ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T00:54:34.691461Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2607.28642"},"observation_digest":"sha256:0ebdee420de158c52bd4fee3c483f670f6098fc1b81ec8111df02040f9f6e98b","observation_id":"b63273ff-1c3c-404e-80a4-b52983f59eaf","resolution":{"observed_at":"2026-08-03T00:54:34.691461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-05T00:22:11.790955Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00782","last_updated":"2026-08-01T17:29:14Z","snapshot_observed_at":"2026-08-05T01:20:54.409796Z","submitted_at":"2026-08-01T17:29:14Z","title":"Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T00:22:11.790955Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2608.00782"},"observation_digest":"sha256:15143c818ef6d9668572c17fcf50bcceb67f824aa4c06e062946102da5d55104","observation_id":"a42e0a42-fd54-465f-abd3-48eec6029a8d","resolution":{"observed_at":"2026-08-05T00:22:11.790955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.11456/citation-record","integrity":"/paper/2504.11456/integrity","json":"/paper/2504.11456/citation-record.json","paper":"/paper/2504.11456"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-03T16:01:59.567237Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":"2502.17387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-07-04T16:39:58.415508Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models","venue":null,"work_id":"00edb0c5-3c62-421d-a532-03e2594f1dba","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:b7ea0977635031db251a9219a7cdff290569c344ea9c175edd82112d26d930a1","observation_id":"26485edc-3072-4b24-925c-5d34a4ec5208","resolution":{"observed_at":"2026-05-16T10:31:04.818649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":"2502.02737","doi":"10.48550/arxiv.2502.02737","metadata_source":"pith","pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","venue":"cs.CL","work_id":"8472f581-14d4-40f8-8189-62ed8b470c4e","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:f5ce3d1a046a04029ca5265372215ea3aaf7ab69415bc04c26132a6b40e2663d","observation_id":"b931d842-000d-4550-aadb-f6fe85a48a11","resolution":{"observed_at":"2026-05-16T10:31:04.753989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T07:19:40.857163+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T07:19:40.857163+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.468","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"doi: 10.18653/v1/2023.emnlp-main.468","venue":null,"work_id":"8d54fadf-29e9-49ff-aab2-e9bc4679ef97","year":2023},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:dd0c71e6f9bad28791ad3c26c6edb2e1d3b09492ef450567b3d5628ae8b86af8","observation_id":"1689582a-6927-475c-8f48-ed77d2dfcab2","resolution":{"observed_at":"2026-05-16T10:31:04.746785Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2412.21187","doi":"10.48550/arxiv.2412.21187","metadata_source":"pith","pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-07-10T11:37:03.272167Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","venue":"cs.CL","work_id":"d79f8b7d-560d-4fbd-bd70-4d084f6d9ad6","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:675f7a044cd076b866eebc8f4c4cc2e1054085fc9fba48e5fe1b8dc0b61ff4db","observation_id":"2d5c5678-3006-4d48-a05d-14ba7ab3a382","resolution":{"observed_at":"2026-05-16T10:31:04.759798Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:f79875a8cbeb4e72732eb0547c1282b4d43dd5fe2e50131dd4255d384cf9eaac","observation_id":"d4bb8b0b-0c52-479f-810f-09d643e3c0e6","resolution":{"observed_at":"2026-05-16T10:31:04.765546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:9b132b346dff9acaefad65a473c7188426b1731e5174fb61296639ecc52514dc","observation_id":"46dd5051-9a31-473e-b041-bdf3603445f9","resolution":{"observed_at":"2026-05-16T10:31:04.770958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.16219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:16:13.421349Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn’t","venue":null,"work_id":"efe39feb-3afa-48ed-9725-593906f19aac","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:e23c41bdcf8256d7000b430dc79092d9e33ea7ab9af0238f2ba755617464b3dd","observation_id":"adfc2564-27b3-4004-9acd-8578b2f4171b","resolution":{"observed_at":"2026-05-16T10:31:04.776854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18321","last_updated":"2024-06-26T13:02:35Z","snapshot_observed_at":"2026-07-06T18:37:17.280637Z","submitted_at":"2024-06-26T13:02:35Z","title":"MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data","version":1},"cited_work":{"arxiv_id":"2406.18321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18321","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"org/abs/2406.18321","venue":null,"work_id":"2023a0a2-fc70-4ada-8f9b-7b1e5ac05dc4","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2406.18321","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:d9b1ee5e075990f41bdbb6582670d288f141ac053ad7267b6bacf260ec254764","observation_id":"d7fd0904-dc6b-4b76-8db5-42c463690aca","resolution":{"observed_at":"2026-05-16T10:31:04.783711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":"2503.01307","doi":"10.48550/arxiv.2503.01307","metadata_source":"pith","pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","venue":"cs.CL","work_id":"f65a84bf-c5b4-4491-a618-18bb263c60e5","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:fb0b9a5e28fce41ba51ef52bae0846efeb817024ae771fcec7c48db41270f311","observation_id":"2033577b-b2b8-4cda-a571-46374563bd24","resolution":{"observed_at":"2026-05-17T11:40:33.380427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-02T10:35:57.002867Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:5f52a5351a36efba2d508fc4e737c88e72856bdbb86ad71e0ad524e67b28b2ab","observation_id":"85cff00c-7d90-46d5-a7ff-42656da1cbae","resolution":{"observed_at":"2026-05-16T10:31:04.794480Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:d856e80b6c5614e523451e87615b25b01654ef8b64069a4c3382c272a67346aa","observation_id":"995d756a-08af-4938-8ce5-992406dc104c","resolution":{"observed_at":"2026-05-16T10:31:04.799231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12753","last_updated":"2025-03-06T12:55:25Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:20:53Z","title":"OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI","version":2},"cited_work":{"arxiv_id":"2406.12753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12753","snapshot_observed_at":"2026-07-03T05:57:41.685515Z","title":"arXiv preprint arXiv:2406.12753 , year=","venue":null,"work_id":"5d74b517-9d7e-41f0-ac0f-52ac4de39560","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2406.12753","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:6b378f202efab1e8037e3a738aefc8d0db9cbe5ab7ce68ec4e1ba17c23fe97fa","observation_id":"630c41d4-ba8c-462e-826c-c081c0fff7ab","resolution":{"observed_at":"2026-05-16T10:31:04.804127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fd873cea-822a-4942-bab2-92cf9f47f2f4","year":2022},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:43984204d935968f64edd3bb99743895817b1cba922b10a8eb12ecd2fa2a6413","observation_id":"447177ca-6f1b-4e07-a775-d9c9af612eb1","resolution":{"observed_at":"2026-05-16T10:31:04.847365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09003","last_updated":"2024-12-16T06:13:03Z","snapshot_observed_at":"2026-07-06T17:16:38.221230Z","submitted_at":"2024-01-17T06:48:16Z","title":"Augmenting Math Word Problems via Iterative Question Composing","version":5},"cited_work":{"arxiv_id":"2401.09003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2401.09003 , year=","venue":null,"work_id":"2c5a2044-9541-4ba8-b905-94fd6c8b0c6a","year":null},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2401.09003","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:1503e7755b16d47b510c8269081d568d5e8e898e815992ac79a5435512fa4dea","observation_id":"d5894fd5-b3aa-497a-bb74-22d163c92241","resolution":{"observed_at":"2026-05-16T10:31:04.823272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-07-06T21:13:45.700548Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":"2504.16891","doi":"10.48550/arxiv.2504.16891","metadata_source":"pith","pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2504.16891 , year=","venue":"cs.AI","work_id":"36221a56-7f42-4451-a935-a3eadab98ed4","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:3312a5e54d819e4c4a899ced2b5d73e3be32c483963bc6f0b6245f0fd2a573bc","observation_id":"da5f633b-de98-4e75-bf85-fc411aeb19d8","resolution":{"observed_at":"2026-05-16T10:31:04.827741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"25dcb52c-77e1-4773-85fb-529cbacc9d8d","year":2019},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:3232b812b4d6bdb6c0cd7085388205618bba2d1a50ae075f68f5b0bdd315b32e","observation_id":"e3eba730-9185-4187-8c01-ad0fe37424e1","resolution":{"observed_at":"2026-05-16T10:31:04.850220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-07-10T20:57:34.817516Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:92ee67ddbd994008d63adcfdbfcd69c84465276699d908107770ef0e6d49bdad","observation_id":"8a257143-90ed-4c71-aeae-4cc1c5ca0954","resolution":{"observed_at":"2026-05-16T10:31:04.831503Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:bcbb2e7658b34c8a285230388a2c6646f18a6c96fe680f5dd3f074fe00b76810","observation_id":"8564cbcf-f582-49d1-a4be-81653f58aff0","resolution":{"observed_at":"2026-05-16T10:31:04.835825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01560","last_updated":"2024-10-05T03:54:22Z","snapshot_observed_at":"2026-07-06T19:26:02.193680Z","submitted_at":"2024-10-02T14:00:09Z","title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","version":2},"cited_work":{"arxiv_id":"2410.01560","doi":"10.48550/arxiv.2410.01560","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01560","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Openmathinstruct-2: Accelerating ai for math with massive open-source instruction data","venue":null,"work_id":"d0d00013-20dd-4e35-88f4-684493941d6d","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2410.01560","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:c7fa73e9e063bf24cae6245d1bced79843dd235cf5b80341557c113bf7a1399e","observation_id":"5e1f518d-fd3c-4fe2-a780-f461cb2b8e55","resolution":{"observed_at":"2026-05-16T10:31:04.839943Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:5d7d598e7144da2298a665780f025dc238546fd3bebee2ee8dcd5f92b40053fb","observation_id":"9cc0c66f-1531-4f89-8ac8-883264aa5fc7","resolution":{"observed_at":"2026-05-16T10:31:04.843987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:aba33e2636faa40512f4d334a317a8b0c60d533e25e51de93a24f71dca2a5b56","observation_id":"629dd6a8-b5e8-4559-b592-026a21ba435b","resolution":{"observed_at":"2026-05-16T10:31:04.813214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02807","last_updated":"2025-04-03T17:52:07Z","snapshot_observed_at":"2026-07-06T21:03:50.078667Z","submitted_at":"2025-04-03T17:52:07Z","title":"MegaMath: Pushing the Limits of Open Math Corpora","version":1},"cited_work":{"arxiv_id":"2504.02807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02807","snapshot_observed_at":"2026-07-04T01:09:19.755056Z","title":"Megamath: Pushing the limits of open math corpora","venue":null,"work_id":"cc63ee94-8d30-4dad-ab33-05247e9e7b7b","year":2025},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2504.02807","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:9709b0f182c5413d2722d675e4bc745de8874c571e7ee105e80fd72f92c9310c","observation_id":"ae8240d8-0d89-450b-876c-8366c45afb75","resolution":{"observed_at":"2026-05-16T10:31:04.809020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":1,"verified_exact":10,"verified_fuzzy":1},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 71 inbound Pith citation observations for arXiv:2504.11456."}