{"as_of":"2026-08-07T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ecb2334d96c8fa8355236d5c2c42b64a93a79e7593d852c6b1904c860ba4777","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:06:35.501572Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:04:14.050518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T18:45:16.641012Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2505.05470"},"observation_digest":"sha256:92c1e2fdbfe30fa8a87ac4634f9a57179f8708d55a17d02c3520ee7c9bb4c09d","observation_id":"fe7e1c32-886c-47e8-8499-7d151890b587","resolution":{"observed_at":"2026-05-11T18:45:16.862524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T11:04:14.050518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.050518Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:20844ea8d11e2dd25e80d962ff70941d87a4342a51686fb94ae8778af326e7dd","observation_id":"106c8006-b943-42f6-89be-79b3fc2895ba","resolution":{"observed_at":"2026-08-07T11:04:14.050518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T00:41:33.940080Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-07T00:34:10.663963Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:33.940080Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:504afd5b6d6310fe0bdab4874294aeb8a530828108d3e19b0e7bfdd2561d86a5","observation_id":"c2edf7f1-ed2c-4a8f-80a6-07974803d571","resolution":{"observed_at":"2026-08-07T00:41:33.940080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T00:14:22.519933Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.519933Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:79dc0797cdd9677d3f9824c6157316a45d4719a6a0acde3e43d5d53c582283c9","observation_id":"2a0e87ad-35f9-427c-8aae-3ec1f1dfbbb9","resolution":{"observed_at":"2026-08-07T00:14:22.519933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T18:57:38.595495Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-06T18:49:43.181677Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.595495Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:77c719962d270ec9ac4808fe15a148e5da66927b87150fe0637fe6bf17ae9ddc","observation_id":"162c4416-8a67-4ce8-9d07-a7313e31f590","resolution":{"observed_at":"2026-08-06T18:57:38.595495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T17:32:30.634578Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-06T17:26:10.296563Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:32:30.634578Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.10535"},"observation_digest":"sha256:f5003aff9d48699995ff547fb81d19b162938eddff6fc5ac3995ae08245a2686","observation_id":"6712258d-8282-40f6-ad1f-31d0bc269b16","resolution":{"observed_at":"2026-08-06T17:32:30.634578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:d7b3437c94c2e0ea1271d80f0fed42de1c136b81a8880ee8438c4aabaaa8b99f","observation_id":"7ea75ee1-7bc6-480f-8cec-9b1aa1fdea48","resolution":{"observed_at":"2026-05-21T23:24:26.284917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T14:11:51.663587Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19748","last_updated":"2025-07-26T02:45:10Z","snapshot_observed_at":"2026-08-07T02:57:59.431631Z","submitted_at":"2025-07-26T02:45:10Z","title":"JT-Math: A Multi-Stage Framework for Advanced Mathematical Reasoning in Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T14:11:51.663587Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.19748"},"observation_digest":"sha256:47db00acab7410156c9b22273842c0d33cb3e62fadba8ca1cfc3eb944730bd80","observation_id":"9a6aba26-2b8e-416f-827a-99da7e9707bb","resolution":{"observed_at":"2026-08-06T14:11:51.663587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T22:48:32.672774Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07159","last_updated":"2025-09-08T19:15:38Z","snapshot_observed_at":"2026-08-06T13:09:30.248335Z","submitted_at":"2025-09-08T19:15:38Z","title":"PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:48:32.672774Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.07159"},"observation_digest":"sha256:c6d37fb2975e720a70051d836c40724bfbdaa884509815f79e777af339bc324c","observation_id":"77c19d91-9dd0-49e4-bf54-bcd3b4dcf963","resolution":{"observed_at":"2026-08-04T22:48:32.672774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:8d1a6265ba5be7a37d9cadfb277a43a579a6203c4ec555d2c3797414c20e69d6","observation_id":"2500b2d5-6c02-4916-99b1-335cb24575aa","resolution":{"observed_at":"2026-05-18T00:02:25.126142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2509.20712","last_updated":"2026-04-23T12:06:05Z","snapshot_observed_at":"2026-08-01T01:36:06.945684Z","submitted_at":"2025-09-25T03:22:04Z","title":"CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T15:06:33.991929Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2509.20712"},"observation_digest":"sha256:ac267c9368ed9825665077d7b10be5e4b268197411c522065fafca5fa11047e2","observation_id":"cdc9989a-6d34-43aa-8d34-8c94d1d57ac4","resolution":{"observed_at":"2026-05-18T15:11:32.270447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-04T08:55:58.550417Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-07T17:59:55.480503Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.550417Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:7f6dea3328f8226db6348c4c92e000e11e720ba0723fed29d86b64def3f44c5a","observation_id":"3a280a8b-e968-43f2-8ec5-90bbbe690e94","resolution":{"observed_at":"2026-08-04T08:55:58.550417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-03T23:27:36.778635Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning.arXiv preprint arXiv:2505.16400, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05722","last_updated":"2026-06-03T04:35:07Z","snapshot_observed_at":"2026-08-03T23:27:34.692491Z","submitted_at":"2025-11-07T21:29:41Z","title":"OckBench: Measuring the Efficiency of LLM Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T23:27:36.778635Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2511.05722"},"observation_digest":"sha256:b3a03a16b81bc1cda331e41b2c6d0c9d569564b2235bc6f7b7f26372f9e19a40","observation_id":"8b08caa5-d6d7-401f-be09-9adfd1e9b9a5","resolution":{"observed_at":"2026-08-03T23:27:36.778635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2512.05591","last_updated":"2026-04-23T12:00:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-05T10:26:32Z","title":"Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T00:53:51.251900Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2512.05591"},"observation_digest":"sha256:04f5ed51f2324b636fda58cecdfec36956ba31f9e7d1edf77f36a42479cd6eb7","observation_id":"051254d6-6815-46c0-8514-79096d9ba67c","resolution":{"observed_at":"2026-05-17T00:58:46.311837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-06T21:47:33.826393Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:f84a7214d80146633c8168f23020f6457372676a3fa0bf6685c2bbc2ab97a141","observation_id":"604cc654-1611-494a-a9f5-b122ba7c947b","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.08477","last_updated":"2026-06-04T07:25:57Z","snapshot_observed_at":"2026-07-12T23:51:05.788513Z","submitted_at":"2026-04-09T17:16:07Z","title":"SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:29.695213Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.08477"},"observation_digest":"sha256:e04d9f5124019066c759dd918e84b9ab227a245e42294310daa7209f57120b3a","observation_id":"30ceaf37-843f-45f8-8949-c6f54325ab76","resolution":{"observed_at":"2026-05-11T07:11:01.629864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:4995d659633cfc7b3805dbc446ec93e656cb356e1e27f5456702fb1a436b3fa1","observation_id":"1eac8f59-c2c5-4a84-aa95-f9e582fcd24c","resolution":{"observed_at":"2026-05-10T06:06:19.468811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:2fca652411f8366199b1c719cb3b9853b641cf3097faf5fd8a9d069052ead8ab","observation_id":"963255fd-4918-4ab8-a1be-4b5e861860c7","resolution":{"observed_at":"2026-05-10T05:56:11.305553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2604.21327","last_updated":"2026-04-23T06:32:08Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:32:08Z","title":"Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T22:55:19.471307Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2604.21327"},"observation_digest":"sha256:e9b6e4e0842f4068d9f08194525a9e8ac87e51c798c1d8080662ef610932fc5e","observation_id":"993bcdb0-e451-4784-979e-d0e3b9e60613","resolution":{"observed_at":"2026-05-11T14:16:07.278352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:494025fa6a163d0205a1f2835961235899dd7c7bc0845afe28ae236da95b7b23","observation_id":"edc3109a-db52-4c8f-b539-c362704567e8","resolution":{"observed_at":"2026-05-10T23:45:53.101099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:d4278a1a9e2b397be83e5c5534e3b39c950c7e32fd5829b74376338b3da8f75f","observation_id":"8cc6f019-6d8f-482f-924f-841fba0a9cdf","resolution":{"observed_at":"2026-05-13T07:37:29.841604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.12384","last_updated":"2026-05-12T16:47:40Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:47:40Z","title":"Scalable Token-Level Hallucination Detection in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:23.534294Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.12384"},"observation_digest":"sha256:fb975c70b2e2f69a041bb9f5c48456b80747160a14008489d32c59cb3eb5815f","observation_id":"2c103f40-2966-4ba2-9c42-93d845d2059d","resolution":{"observed_at":"2026-05-13T05:52:22.421954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:51:17.595707Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.13255"},"observation_digest":"sha256:8234df9515b91b9c51e77d11e1203f14a147d765477ca52338de7f1f1f24a2be","observation_id":"4e0abeda-e4b8-4968-8653-cb0b3fd38774","resolution":{"observed_at":"2026-05-14T19:52:52.411736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.25864","last_updated":"2026-05-25T13:55:12Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:55:12Z","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:46.313028Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.25864"},"observation_digest":"sha256:3a40c02ef225a4e7898aaf53d0c47ba2d22ca153dd60fc24c4e4830077a9ef3b","observation_id":"4d9f336e-c8ca-4339-b799-afc4c8a24a24","resolution":{"observed_at":"2026-06-29T23:04:01.322678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T19:34:12.081362Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2605.26971"},"observation_digest":"sha256:fb8b6d2716efc41937182bc8d89f249a56c10b106a95509389f6f1054ec5553c","observation_id":"49c626dd-add2-429b-a250-05b5da73c1f4","resolution":{"observed_at":"2026-06-29T19:43:55.053657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:c851adf431c52fa632c28c07bc0d3e653c33da19800a84b0906de25915f197fa","observation_id":"cae54978-a304-4bb7-9065-517d124851da","resolution":{"observed_at":"2026-07-03T20:38:55.942362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.19771","last_updated":"2026-06-18T04:11:56Z","snapshot_observed_at":"2026-08-06T02:52:06.478211Z","submitted_at":"2026-06-18T04:11:56Z","title":"Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T17:37:43.856000Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.19771"},"observation_digest":"sha256:1636ca1d90bc1d5b03fdcec5b643f463a028a1944a3062654f97656b63a13f38","observation_id":"f080444e-7265-48f3-befc-cf754f9647fc","resolution":{"observed_at":"2026-07-04T03:49:30.159779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.16400","doi":"10.48550/arxiv.2505.16400","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":"ArXiv.org","work_id":"428ad314-c120-41da-9db7-b8bc1918fffb","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:8f3198724c8e0a47bf713e0f994aa866190eaf0891dadc1670583347b6efc4c9","observation_id":"4afb7a0a-b48a-4c0a-ab97-a7d8e16d28ed","resolution":{"observed_at":"2026-07-04T09:09:43.581253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-02T06:37:36.445162Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.445162Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:c7c96467a3a1c82c66a8ac689ca328598f54f3001640a4a87b313598a2259ecd","observation_id":"70ba9640-73f3-4a19-bd19-009a3d40a001","resolution":{"observed_at":"2026-08-02T06:37:36.445162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16400/citation-record","integrity":"/paper/2505.16400/integrity","json":"/paper/2505.16400/citation-record.json","paper":"/paper/2505.16400"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T15:06:35.285362Z","title":"Opencodereasoning: Advancing data distillation for competitive coding.arXiv preprint arXiv:2504.01943, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.285362Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0bc37f73fefaf291c6d350b1736a0af25a69c10df241110774be1f6c8ab5210c","observation_id":"bc0f1d88-e512-4685-a69c-d708aada8cb3","resolution":{"observed_at":"2026-08-07T15:06:35.285362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-07T15:06:35.291514Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.291514Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:5fee5924ac8341ea437e912b043dda8bcb2515a785a95f1144c7cc4669258fd1","observation_id":"cf4fbbea-9329-4e47-9ac9-32d3b8e00df8","resolution":{"observed_at":"2026-08-07T15:06:35.291514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.273404Z","title":"Matharena: Evaluatingllmsonuncontaminatedmathcompetitions,February2025","venue":null,"work_id":"f1d5b1ec-e289-410f-860b-8e6178d0dc0f","year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.296648Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:7ce83875f5fe238304e6af211f406aaa45a2ebecc0b51207d8a4a0f64aaded3b","observation_id":"63df6452-c98d-437d-9275-daf942bf2c46","resolution":{"observed_at":"2026-08-07T15:06:36.278571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.302290Z","title":"Llama-Nemotron: Efficient Reasoning Models.arXiv preprint arXiv:2505.00949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.302290Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:25aab4b9002e591b37f24748922c009d0226c4f5462c7cdfcfdbb64c4e37a32b","observation_id":"8d71d6b6-2bdf-41c3-9e4b-c08397732127","resolution":{"observed_at":"2026-08-07T15:06:35.302290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.257698Z","title":"Bridging supervised learning and reinforcement learning in math reasoning.arXiv preprint, 2025","venue":null,"work_id":"e64bcdc7-c633-4dd3-bd1e-111ed13334df","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.307091Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:9ee34065f9a75c6b6475044873c762ef9fc641114317ba811a0dde67f9e0a93f","observation_id":"020157d3-fd39-4ff5-b0a8-5098219e32dc","resolution":{"observed_at":"2026-08-07T15:06:36.262756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T15:06:35.311936Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.311936Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:e3b9d161c4e2f0e26d4040bfbf6186a9d8bf030f765d7d0c12812f6029e08c25","observation_id":"5190ac7e-046f-47b0-a9a9-66545e9cb3d2","resolution":{"observed_at":"2026-08-07T15:06:35.311936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:06:35.317188Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.317188Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:f3fb37a4554953ce8a93b935a8d30f6fb0c4578bf87354cc92bbfb2cfce05201","observation_id":"ffe16904-0259-44f0-ad08-81046c0cb338","resolution":{"observed_at":"2026-08-07T15:06:35.317188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:06:35.322184Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.322184Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:056872d167cd02a99d90c5068dee1c4c823103339325346c3f7ef5c0d3ebc0e5","observation_id":"887e1314-3873-42ed-9526-052b06796094","resolution":{"observed_at":"2026-08-07T15:06:35.322184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:06:35.327654Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.327654Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:48165b7e2c0c6053b64b7e3824f50d425f1d81373000b8af9b660872d9d8f178","observation_id":"652fbdd3-cbb5-4d55-a749-836820c87e0d","resolution":{"observed_at":"2026-08-07T15:06:35.327654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T15:06:35.333225Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.333225Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:3527caa53c220a2db22497df3daf293c6827a68b2b0df7dc906db9541946f3af","observation_id":"81e55ba2-3080-4c5c-a19c-19e60495eb29","resolution":{"observed_at":"2026-08-07T15:06:35.333225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:06:35.338695Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.338695Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:7a976a1639969a9fe4f21f1527c4b12e8e54d7410adb7bb8fd747d8e75bcad42","observation_id":"34d09bcb-f26b-439d-bf7f-56042ab63c9f","resolution":{"observed_at":"2026-08-07T15:06:35.338695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.241766Z","title":"Skywork open reasoner series, 2025","venue":null,"work_id":"e1b8b316-9eaf-4fad-954e-310d3e4c561d","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.346308Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:68b1c70ba16a8d32886f92e497afa71eaf32c8ef294c26bd885610af5398c9c5","observation_id":"245b7b6e-9de9-4fa0-81e2-ab6f86cd1c27","resolution":{"observed_at":"2026-08-07T15:06:36.246484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.226488Z","title":"Measuring mathematical problem solving with the math dataset.NeurIPS, 2021","venue":null,"work_id":"0e7860a0-9a49-440e-8610-9a2c7c77802d","year":2021},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.351544Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:67e2d844f0e25b5ed23086a4743011ca7c499117de443cb42f0f792fa4ff8ab7","observation_id":"0a914012-d692-4cc1-bae7-f1ee13803624","resolution":{"observed_at":"2026-08-07T15:06:36.231267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.211374Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"fb2b1ca0-fdca-4867-bbaa-a94333bd6298","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.356186Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:f36e3580dfac440389c95f5d1518ce8d007008536df145f220343f5874d91584","observation_id":"5c83f9db-dfb0-41f0-bbef-712e9d7a46e3","resolution":{"observed_at":"2026-08-07T15:06:36.216361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T15:06:35.360560Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.360560Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:980d86b54957f80653c436d89dae6c44d6c7a9a9b93c692204177335c19f73d5","observation_id":"90ee0e6b-52ff-40bd-ad18-0ff352523cd9","resolution":{"observed_at":"2026-08-07T15:06:35.360560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:06:35.364966Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.364966Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:e6c649e9db4dac90bb5932c24ae24023090826c2420e1877d069583b08d02cad","observation_id":"0553564d-8612-4b45-8336-a6a2a33ca38f","resolution":{"observed_at":"2026-08-07T15:06:35.364966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.369809Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.369809Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:23fad6c81358cac89de9917b23f90c28407bb97a40091e002a7c186438f604cd","observation_id":"52356d23-5f99-4217-b9d9-d08978ed2ce8","resolution":{"observed_at":"2026-08-07T15:06:35.369809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.182330Z","title":"Numinamath","venue":null,"work_id":"2d18e057-5759-40a8-92a7-b611989cd5ac","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.374725Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:83d5cf69d25a51bcd0c514345bac083b93c7e3fc413c03f0d8fd5c97ba6b6d06","observation_id":"77e21b3b-f8f9-48b9-8a42-71f26ff1a087","resolution":{"observed_at":"2026-08-07T15:06:36.188890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.166594Z","title":"Let’s verify step by step","venue":null,"work_id":"72c41abf-3a90-4994-8f44-173d52e19227","year":2023},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.379388Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:70daacd751c4ef5b4c42c224b2f4406f20b5eaafc2f473a3441072f769010860","observation_id":"d6ef4e8f-f597-4ef6-b2de-afb965259a57","resolution":{"observed_at":"2026-08-07T15:06:36.171672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:06:35.384699Z","title":"Deepseek-V3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.384699Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:ee0288dac7a145e7e862dfc9908e6407c965a3b947b98753835d4286644a64c2","observation_id":"77f105be-63c4-4387-b8b9-392d2da950e6","resolution":{"observed_at":"2026-08-07T15:06:35.384699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T15:06:35.391101Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.391101Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:729c300dec3f3dac5ab385dc6c114039445ee02140a9d46e62a1bc867c78f3f5","observation_id":"62ea21e6-726c-4955-80ee-87ba1fac670b","resolution":{"observed_at":"2026-08-07T15:06:35.391101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.151236Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"bb41eb1a-e0cd-40e6-a024-706d8cf29041","year":2023},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.396473Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:6731c0a39afa0065f7650f84c9aa2e66bb370fc0469c060b6b37992075bcb315","observation_id":"bca7eb50-4e78-44c8-b247-6e032ef6b77c","resolution":{"observed_at":"2026-08-07T15:06:36.156142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.136153Z","title":"Evaluating language models for efficient code generation","venue":null,"work_id":"4ca48f5d-1cd8-4588-bfdc-9390e623c8ea","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.401772Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:91cb0f3c802be5c685041d76b2897baacc87c43649f78e85329c92b28d134aae","observation_id":"18a06f92-5396-49aa-895d-690b15053bc0","resolution":{"observed_at":"2026-08-07T15:06:36.141039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15084","last_updated":"2025-01-17T07:12:55Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:29:44Z","title":"AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15084","snapshot_observed_at":"2026-08-07T15:06:35.406551Z","title":"AceMath: Advancing frontier math reasoning with post-training and reward modeling.arXiv preprint arXiv:2412.15084, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.406551Z"},"links":{"cited_paper":"/paper/2412.15084","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:011079ddbb94f1fbcfb57439ce638ab8ddf8c2e48cedd002a69018deb7a68d75","observation_id":"943f7d5d-3417-4c90-a906-f22ca245594a","resolution":{"observed_at":"2026-08-07T15:06:35.406551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.120406Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":"73d17662-6c01-4e51-b9de-4c64fe49b8ae","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.412153Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:30c2f61b50063716142085678e9b31bacefb685220707a2df2884ea53cd0ff27","observation_id":"f62916a8-3707-488a-871f-4ba17fc61ac8","resolution":{"observed_at":"2026-08-07T15:06:36.125432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.104382Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"3caa649b-3a2d-4ca4-a9c5-e0098e59c75e","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.417224Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:597e900dc096b87965511ee97cc85e39c88218779583c0d0661c65cbcfead627","observation_id":"64bde935-b262-40a0-9b46-8333690e42c4","resolution":{"observed_at":"2026-08-07T15:06:36.109543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:06:35.422347Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems.arXiv preprint arXiv:2412.09413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.422347Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:00d67123abc7367e73f992d4ed1d99defd31930fd91a4b33a8692b1bf89ca9cb","observation_id":"801014ec-d30e-4b72-a28d-a34a81e0fd50","resolution":{"observed_at":"2026-08-07T15:06:35.422347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-07T15:59:48.302908Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-07T15:06:35.426645Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with openmathreasoning dataset.arXiv preprint arXiv:2504.16891, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.426645Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:d2fe67836ab656fea05de54409b308f0fd1d3f9b7775fc2c56aa2b2505b1c401","observation_id":"b3932edf-1f19-4485-917b-1965519b2f19","resolution":{"observed_at":"2026-08-07T15:06:35.426645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.088887Z","title":"Learning to reason with LLMs, 2024","venue":null,"work_id":"2c216a38-4bb3-4ccb-a9e5-a65a68f89e6e","year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.432368Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:1c68fe941985828882504acc6285aaded5a87520a30fc36113c7fcd828ca2908","observation_id":"f594eac6-4b05-4fe9-83b7-3d3ecbd2a1b2","resolution":{"observed_at":"2026-08-07T15:06:36.093590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.071344Z","title":"Qwen3, April 2025","venue":null,"work_id":"52cbf93c-dfe5-4bf9-9e70-e921e6ed5714","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.437045Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:16c24c0d773d835067c2a466550bd4ffeae5f1104cdb8a1e9dc9689ac08c61a8","observation_id":"5cfdd2fb-dfd5-430c-a1a6-72f17cf6f8a4","resolution":{"observed_at":"2026-08-07T15:06:36.077528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.054173Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"4d8a86ea-8f31-4561-80a5-b30a915ac86f","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.441505Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0d3fa162078b1dd151c73551e168f353718c180697f465f8145e8a19b8bc89dd","observation_id":"c908a22d-9724-4234-acba-4d09f27f2be7","resolution":{"observed_at":"2026-08-07T15:06:36.059219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.037945Z","title":"Areal: Ant reasoning rl.https://github.com/inclusionAI/AReaL, 2025","venue":null,"work_id":"818adcaa-0fc9-4226-804d-3aeb07514fea","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.446011Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:d7c3f18f7bcab5b21babf45a8aa9fe4b1e8ec37d912a90b69af69762ffc4801b","observation_id":"6dc5eecb-f298-4121-abf4-4b3f9ed98fcd","resolution":{"observed_at":"2026-08-07T15:06:36.043379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:06:35.450509Z","title":"Proximal policy opti- mization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.450509Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:91fee30f7974519e62e0b46ca38577ea977c378a3a9c219e8ec364fee3c98fed","observation_id":"ffa884c3-6476-46db-97a6-685fd284f4db","resolution":{"observed_at":"2026-08-07T15:06:35.450509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:06:35.455071Z","title":"DeepseekMath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.455071Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:04f84febc88454f7b589af2a27fc2cf37b0cef68843401c240ee01261142db7c","observation_id":"16f4defc-df20-453b-8f91-72d0605aa93a","resolution":{"observed_at":"2026-08-07T15:06:35.455071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:06:35.459500Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.459500Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:442488a2da02093b2917b3e3ee443e9eda7e0743b8bd822647a69327b051c6e9","observation_id":"570359b4-1457-4bfd-a6db-e7e87a6ef781","resolution":{"observed_at":"2026-08-07T15:06:35.459500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.021098Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":"842ee798-d3bb-4054-9cdb-9d3842d167a7","year":2022},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.464091Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:0afcec8107a381c330eb99c489431556198272fa7e2f88213cd8322e0a3d0448","observation_id":"e9c27ef8-6b48-43f1-904d-7af7db4955f0","resolution":{"observed_at":"2026-08-07T15:06:36.026419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-07T17:06:45.905806Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T15:06:35.469350Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.arXiv preprint arXiv:2503.10460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.469350Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:e1f4ebbaa0a8148a72ecf2acfc31836b7f3f93651a2afa0158bb1e0e09d974c8","observation_id":"51031af8-96fb-4a71-ae2a-093c23cca5ee","resolution":{"observed_at":"2026-08-07T15:06:35.469350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:36.004035Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8:229–256, 1992","venue":null,"work_id":"bd7f45bb-44ec-4cd0-9225-9aaa1ac3d3ee","year":1992},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.474413Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:3fc537b4720113f200dd7a6ed420891dc2688dbbeeb357315ce981c79bf3c384","observation_id":"0986e787-4d8d-4456-8c8c-e0b2d8b4c211","resolution":{"observed_at":"2026-08-07T15:06:36.009629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:06:35.478748Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.478748Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:cc1a151ebf7feb60efcfb81fc785853c0b794ae6d6f9575932d3cdbaa3d8ab73","observation_id":"48f6a565-6fa7-4c1f-b5f9-30faffd8f681","resolution":{"observed_at":"2026-08-07T15:06:35.478748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:06:35.483074Z","title":"Qwen2.5-Math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.483074Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:ef78d76a14dc2c34a3f559b9ef3358a19c9eb5ff7b0fd992934f50eeb0afac96","observation_id":"88905fb7-ae1a-483f-a07f-345628fd43d2","resolution":{"observed_at":"2026-08-07T15:06:35.483074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:06:35.487503Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.487503Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:20c7c672e2ade1e06a75fdee862f42507567deca87f07eb36802cc08cdbe4bbb","observation_id":"510d0643-00d6-4fef-aef8-1ab9ad7221ec","resolution":{"observed_at":"2026-08-07T15:06:35.487503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T15:06:35.492037Z","title":"Does rein- forcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.492037Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:2bffef285ada392c7900060e21afb9614abd046f066ff25c334aabf8b6f59074","observation_id":"611726fe-6b2d-409d-8c1d-77e4328403d1","resolution":{"observed_at":"2026-08-07T15:06:35.492037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01718","snapshot_observed_at":"2026-08-07T15:06:35.496885Z","title":"Acecoder: Acing coder rl via automated test-case synthesis.arXiv preprint arXiv:2502.01718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.496885Z"},"links":{"cited_paper":"/paper/2502.01718","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:4b77fabef5b548f96a5a4c96e81ddb9b309116e29a1cda805c2e6a45f5453b96","observation_id":"ca8ca9ec-51a5-4129-a6ec-795d41618fb8","resolution":{"observed_at":"2026-08-07T15:06:35.496885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:35.985121Z","title":"r’s **, let’s break it down step by step. ### Step 1: Understand the Context - It seems you’re referring to the letter **","venue":null,"work_id":"80177c5e-4733-4458-81e8-2f6d80b15bbc","year":2025},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.501572Z"},"links":{"citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:3439feec6b1789422cc2eea39c5237765aae1cd4cc562d4e56c77c42651df4d9","observation_id":"2b6e39db-4943-4156-866b-1525df2d61e7","resolution":{"observed_at":"2026-08-07T15:06:35.992091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 29 inbound Pith citation observations for arXiv:2505.16400."}