{"as_of":"2026-08-11T08:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed67a6fdca0da1d09f4f380f227ff88af38bc6a40899d2c2a4a36364212e683b","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T12:44:27.769465Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":86,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:17:53.443925Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-07T15:42:21.129156Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11027","last_updated":"2026-05-25T11:34:07Z","snapshot_observed_at":"2026-08-07T15:35:52.039637Z","submitted_at":"2025-05-20T11:28:48Z","title":"From Reasoning to Code: GRPO Optimization for Underrepresented Languages","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.129156Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2506.11027"},"observation_digest":"sha256:216536a2b39239c0727885a1c6bc2222e0958e307e400aa39d1d652bc8f15eb5","observation_id":"c8c83820-e531-4d45-9f9c-500a770b25d5","resolution":{"observed_at":"2026-08-07T15:42:21.129156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-10T12:54:04.823142Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:91254b7c6f3c135198609fac178ce6b9f560446abba5065f78794829831c68ea","observation_id":"df4d5d63-c7c8-4137-ac54-04eaa3f322c9","resolution":{"observed_at":"2026-05-21T23:24:26.306377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-06T10:28:55.422601Z","title":"Preprint, arXiv:2506.14245","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2507.23776","last_updated":"2025-07-31T17:58:25Z","snapshot_observed_at":"2026-08-10T16:09:20.367268Z","submitted_at":"2025-07-31T17:58:25Z","title":"Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:28:55.422601Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2507.23776"},"observation_digest":"sha256:57511648289382003946c20b45632088b04e294d514f88acf49901828513991b","observation_id":"c8671764-0901-48f0-b025-98b5b4980efb","resolution":{"observed_at":"2026-08-06T10:28:55.422601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-04T13:53:35.444747Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25004","last_updated":"2026-06-08T14:01:20Z","snapshot_observed_at":"2026-08-10T18:05:46.222327Z","submitted_at":"2025-09-29T16:29:04Z","title":"CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:53:35.444747Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2509.25004"},"observation_digest":"sha256:44c4ee956cecaefb0ac420dd5d5c67c06214ccc483e879beaee13e9c52ff53d1","observation_id":"f0813485-2174-467c-af2d-4067382cdc97","resolution":{"observed_at":"2026-08-04T13:53:35.444747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:117a4c336c7d9378c008c2917e3c3f58e2035d9fca1d7c81936772d59e48748e","observation_id":"7b46c176-c529-496e-a393-add5908b0750","resolution":{"observed_at":"2026-05-25T07:40:28.693870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2510.07799","last_updated":"2026-05-16T23:46:00Z","snapshot_observed_at":"2026-07-06T22:32:07.945004Z","submitted_at":"2025-10-09T05:28:28Z","title":"Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T20:40:13.721163Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2510.07799"},"observation_digest":"sha256:32c6ac04d315638bc8be6ad5b3ed12fac5bb3879d0aae3eee4ee96e730402ab9","observation_id":"79f1bcaf-9f0f-41a5-af74-317c703a9f33","resolution":{"observed_at":"2026-05-21T20:40:35.717644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2511.14045","last_updated":"2026-05-09T12:37:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T01:51:34Z","title":"Auditing Data Membership in Reinforcement Learning With Verifiable Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:54.702010Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2511.14045"},"observation_digest":"sha256:8d6c44912b7bbdb308e503b2de77d5e9743a4bb5022c27eead35a05932a506a0","observation_id":"7704fabb-9215-492a-b1c0-e5dd933473f1","resolution":{"observed_at":"2026-05-17T21:40:17.708608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2601.06794","last_updated":"2026-04-14T15:14:10Z","snapshot_observed_at":"2026-08-02T16:11:51.558737Z","submitted_at":"2026-01-11T07:29:08Z","title":"No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T16:01:48.789986Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2601.06794"},"observation_digest":"sha256:6d9a99a2b9c48f34762a6cdb7d2cf108e543e80ecebab6d9f5854d9ba5697958","observation_id":"aa1dca30-acca-487f-b4b0-1086a8389b6c","resolution":{"observed_at":"2026-05-16T16:03:04.310183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-04T06:25:54.268990Z","title":"Re- inforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-07T13:32:11.544592Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.268990Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:278e5b4bd7f98053ebbdb967e11fade06291cdd84f8f38f70f0f6894853acefc","observation_id":"0fca62d3-9fac-4363-924b-df5ea3a77cc7","resolution":{"observed_at":"2026-08-04T06:25:54.268990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-03T03:04:44.643557Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.643557Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:ff90c4d2d406bc49127a7abb1123e5f089947e6dc73d886f786f7942b6738c50","observation_id":"0011bb1d-6b65-4435-bdae-0363d142794b","resolution":{"observed_at":"2026-08-03T03:04:44.643557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:c6bb0d3e68f3dd1bfb008f87367428f6f837793a08a0e25587848749f3a8d28a","observation_id":"ab7ef238-a2c3-494d-9dd6-7b4ac94ed9cb","resolution":{"observed_at":"2026-05-25T07:26:41.719095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T23:11:56.783061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-02T23:11:47.613570Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T23:11:56.783061Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2602.14872"},"observation_digest":"sha256:3c1ce4042c1e40ccfb95dfe7ec2acb453bbe32c4b9b8d2c1a6a52090d6915d54","observation_id":"63ab4a7f-3bc9-4d31-878f-e8afd30fe1e5","resolution":{"observed_at":"2026-08-02T23:11:56.783061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-08T17:32:30.075016Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:dd1a88670cc59d4a9ba3a16b7944c83bacee83a4776679ab6071c904b9a177b4","observation_id":"33ad160b-697c-4eb7-9458-1ef6d97d3929","resolution":{"observed_at":"2026-05-15T21:51:40.674171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2603.24591","last_updated":"2026-04-03T16:34:38Z","snapshot_observed_at":"2026-08-07T05:30:30.888846Z","submitted_at":"2026-03-25T17:58:56Z","title":"Vibe Coding XR: Accelerating AI + XR Prototyping with XR Blocks and Gemini","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T00:17:41.692833Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2603.24591"},"observation_digest":"sha256:ffe44b79e428f2e59e01886fb66bf1cea67cf8cfa685bad0e3282bb6575bcd53","observation_id":"8c8861f0-cdee-46ed-80e5-299a150835d9","resolution":{"observed_at":"2026-05-15T00:18:21.564249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.00013","last_updated":"2026-04-12T03:30:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T12:48:41Z","title":"C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T13:51:40.334057Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.00013"},"observation_digest":"sha256:086b5fdf7bc9163b326f23ea6166c38e6dca7dd4e7da1c6b888fe0a4dd2a26ec","observation_id":"e968aa27-6968-4ba1-968a-1ef12cd44a4d","resolution":{"observed_at":"2026-05-15T13:55:53.249343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-13T14:23:49.346727Z","title":"Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye, Zhirong Wu, Yang Wang, Zhijian Xu, Xiao Liang, Junjie Li, Ziming Miao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01475","last_updated":"2026-06-08T13:23:37Z","snapshot_observed_at":"2026-07-13T14:23:49.176171Z","submitted_at":"2026-04-01T23:31:38Z","title":"Interpretable Electrophysiological Features of Resting-State EEG Capture Cortical Network Dynamics in Parkinsons Disease","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T14:23:49.346727Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.01475"},"observation_digest":"sha256:31799dec239083e5152db1bf7ecb488034a2fcfe88b33d36cd1d2e3d8c472773","observation_id":"77482315-5405-4744-b986-a54514bc38d3","resolution":{"observed_at":"2026-07-13T14:23:49.346727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.03157","last_updated":"2026-04-03T16:28:03Z","snapshot_observed_at":"2026-08-11T06:03:51.565545Z","submitted_at":"2026-04-03T16:28:03Z","title":"Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:02:44.124502Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.03157"},"observation_digest":"sha256:7850d011dbd648c61050b8705ec4f02ece4d3034087fcd95fe62a2b7d62ec658","observation_id":"3a833d6e-6843-479b-a267-1a0efbee4e22","resolution":{"observed_at":"2026-05-13T20:03:12.149433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.06192","last_updated":"2026-03-11T18:00:18Z","snapshot_observed_at":"2026-08-03T13:42:05.563208Z","submitted_at":"2026-03-11T18:00:18Z","title":"The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T13:05:26.484571Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.06192"},"observation_digest":"sha256:81f183d0848f7cc222acd68ab7d3281bbf81a05919971fe2b910c3bc8e91edae","observation_id":"8906811d-7d64-4e30-b030-cbe09a2f9ab1","resolution":{"observed_at":"2026-05-15T13:05:38.304562Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.10029","last_updated":"2026-04-18T04:20:33Z","snapshot_observed_at":"2026-08-06T18:17:26.436075Z","submitted_at":"2026-04-11T04:52:38Z","title":"Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:24:28.048403Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.10029"},"observation_digest":"sha256:08ede5b84a654e35c70b3cbe612c9451ed5fafd47740fc1c60d01dc44a82718b","observation_id":"3348998f-c5a2-4a65-bca7-2bc632d57b7f","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-11T03:30:51.869417Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:25d07d757195aedcf66ecf9bf4e1a114b5eab9a4d7d64ba6cc3dc0424f8cd210","observation_id":"a7993578-5777-4df4-9c32-c04bc96f62a0","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.16804","last_updated":"2026-05-06T17:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-18T03:24:54Z","title":"AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T07:02:02.992871Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.16804"},"observation_digest":"sha256:99ba9a541c410617023a01616f39d1fefd36bd8d08a54b2bb6b2dc721bb86886","observation_id":"ff11fec3-bbdb-43d0-95ed-2af57c26a296","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.20398","last_updated":"2026-04-22T10:04:46Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T10:04:46Z","title":"WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T00:18:18.340391Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.20398"},"observation_digest":"sha256:0304f131bc4a96b0836a95c661ab1134b39139177000b40535590d495d449a64","observation_id":"6a234c22-3534-41f6-8b1c-5159bbca5794","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-08-11T00:41:13.716564Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:f249add17204886e627b399279fcc8c3abfd1baaac6f0cbec925a4c1d8e425d2","observation_id":"bcb35224-6a9e-4f1d-bb75-7b1284dc1b73","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.23210","last_updated":"2026-04-25T08:35:36Z","snapshot_observed_at":"2026-08-11T07:38:35.741065Z","submitted_at":"2026-04-25T08:35:36Z","title":"Discovering Agentic Safety Specifications from 1-Bit Danger Signals","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T08:23:38.003940Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.23210"},"observation_digest":"sha256:5ce600d090ba897ac023675d5711c91b3ebdf95df9ba27582f4addcf03b567a4","observation_id":"a16d9e53-f368-4c31-874f-d5e50ee45a38","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.25610","last_updated":"2026-05-08T17:41:03Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T13:18:12Z","title":"Optimizing ground state preparation protocols with autoresearch","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T17:04:34.912728Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.25610"},"observation_digest":"sha256:72f9729be260965a5b25cc90dab0d4fb69f46c8831b422aae491c03efcaa0aac","observation_id":"0415a4d8-153f-42b7-962d-863014de4441","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2604.25610","last_updated":"2026-05-08T17:41:03Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T13:18:12Z","title":"Optimizing ground state preparation protocols with autoresearch","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:09:12.325998Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2604.25610"},"observation_digest":"sha256:836d5597c8a505a97d659de87653ee15141b1b60b8f4955cd22f4dd125182eb3","observation_id":"9c23c0a8-f7a1-4099-8c52-e6e58b50e643","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:ff118f23d9aa3e715834f8eef56e7bdb15dc42840813e4313ad02c533e43f5d9","observation_id":"0dddffff-f69d-4493-8f53-72248841d2be","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.02469","last_updated":"2026-05-04T11:10:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:10:32Z","title":"Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:22.546508Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.02469"},"observation_digest":"sha256:a288926028f0002b2ef8e91e8028b146ef58bedc0a49028d4b4bafba83377434","observation_id":"2dffd715-a828-4070-b5ec-2dfd112bdbaa","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.04065","last_updated":"2026-05-07T04:49:30Z","snapshot_observed_at":"2026-08-11T02:56:20.139486Z","submitted_at":"2026-04-11T07:26:04Z","title":"Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T16:58:10.013475Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.04065"},"observation_digest":"sha256:cb3fb2126baf8a6444bb89f6ea6aa76795b853903254d0a2b512f452476e25c1","observation_id":"d8239cca-5738-471b-b1f7-e3ab3a817cbc","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.04066","last_updated":"2026-05-07T04:57:40Z","snapshot_observed_at":"2026-08-02T15:49:26.057284Z","submitted_at":"2026-04-11T07:34:59Z","title":"Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-10T16:51:19.555272Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.04066"},"observation_digest":"sha256:545b09cdb3f46ac493a12e18e8bef6ce6aa256b6ec4fa530086406bd8c9d4f38","observation_id":"605fb9f0-173f-4166-ad33-2f33f6655427","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.04356","last_updated":"2026-06-02T18:10:56Z","snapshot_observed_at":"2026-08-03T05:38:13.636357Z","submitted_at":"2026-05-05T23:25:00Z","title":"Efficiently Aligning Language Models with Online Natural Language Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T16:55:12.949494Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.04356"},"observation_digest":"sha256:96e71d25867c3c1f026b0b96a3a5c42203619b70f149ba2e00a77852c5426430","observation_id":"62d51b8f-6e7f-4e60-8fea-085f7967a7eb","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.04356","last_updated":"2026-06-02T18:10:56Z","snapshot_observed_at":"2026-08-03T05:38:13.636357Z","submitted_at":"2026-05-05T23:25:00Z","title":"Efficiently Aligning Language Models with Online Natural Language Feedback","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T23:44:39.010504Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.04356"},"observation_digest":"sha256:8b91dcede703d1aa5c651ec4230efbbbc0d66be703f9a9ef8772a7211fb29042","observation_id":"c9eb816b-b0a9-4b62-894a-54e42f5ba987","resolution":{"observed_at":"2026-06-30T23:45:07.593611Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.04499","last_updated":"2026-05-06T05:02:40Z","snapshot_observed_at":"2026-08-11T07:43:58.327917Z","submitted_at":"2026-05-06T05:02:40Z","title":"Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:48:09.078064Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.04499"},"observation_digest":"sha256:1a17e112fa9f6777ceb7b501d3d55910df7dff8f0ffb063c1b39eedc5c4faf7d","observation_id":"68663c42-881c-4f77-bc12-9d7b5a9779f4","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-08-11T05:47:49.384854Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:a1e8f281015dac8da27da00c764fd132e0eab7fd0bc817516904df9b7f9bd337","observation_id":"ccdf6be5-6d72-4abf-a9a4-d721b68be54f","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:5cd639cadf938f4f36c439c16018027cbe5036d938800d6bbfbbc979b43dfe9d","observation_id":"f92258b0-2e12-41a5-9b7f-d0f4f6ad2edd","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.07114","last_updated":"2026-05-08T01:42:25Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:42:25Z","title":"Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:09:27.543625Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.07114"},"observation_digest":"sha256:88586cbb64039bff92832472d69dc678700eb8e4c19e1b7f3e458241aac3e9b3","observation_id":"3e8e6f52-3640-4926-bd8d-e9c90a41bfa5","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.09079","last_updated":"2026-05-09T17:39:26Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:39:26Z","title":"CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:33:04.549851Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.09079"},"observation_digest":"sha256:fe7144855f13de081da3e575761520662f5b0b95fc1e0d3eadb76efb49d91b1f","observation_id":"c6580ab5-e3ba-422e-ac3f-cde0e5d54dad","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.09923","last_updated":"2026-05-13T06:42:03Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T03:19:04Z","title":"expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:30.301154Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.09923"},"observation_digest":"sha256:e7a2b3f02de8f7d09a15377249ffd08cb2e1270bd291cf51987f18a13d54f024","observation_id":"1ddbe0bb-a75f-4756-9302-7b2c86852aad","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.11403","last_updated":"2026-05-12T01:48:48Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:48:48Z","title":"fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T03:06:51.437906Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.11403"},"observation_digest":"sha256:dfca4e931beed19a23d99e63002c9e06469323aed4af59824253b19f71a25c20","observation_id":"1ed35065-6247-423a-b2e5-64c5873eeff2","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.11931","last_updated":"2026-05-12T10:44:35Z","snapshot_observed_at":"2026-08-11T01:46:21.442605Z","submitted_at":"2026-05-12T10:44:35Z","title":"Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T06:17:57.264809Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.11931"},"observation_digest":"sha256:2cb5c91507ccc5ca3afac5e3bdae4c0ffa644f64f304c142ad6d602b6b46b70d","observation_id":"ebc3dd4d-5909-4b02-b835-5cec98e3d1e0","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-11T08:07:08.891786Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:3ade098b17d9fb9c947106e974e1d44e0ebe14bc28fa2f4356df286665e90052","observation_id":"e14f5791-9aec-4dfa-bad1-72e99380fa95","resolution":{"observed_at":"2026-05-13T12:44:27.816864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-11T08:07:08.891786Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:a3e6be53321ff285ed34134d143fdccf79aa7726548c5d740bee1273bfa2797a","observation_id":"e61f42e1-8c5c-4827-8c7b-f6674608dfbe","resolution":{"observed_at":"2026-05-22T10:01:23.109055Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.16874","last_updated":"2026-05-16T08:33:31Z","snapshot_observed_at":"2026-08-01T16:12:13.947960Z","submitted_at":"2026-05-16T08:33:31Z","title":"Reasoning Can Be Restored by Correcting a Few Decision Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T20:56:48.771058Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.16874"},"observation_digest":"sha256:f52f71dcf37a0b3641926e27c3c4761a37f9017288b796cb6e642d4353d32491","observation_id":"c3b606eb-4205-4ba6-9a09-d807c49b625e","resolution":{"observed_at":"2026-05-19T20:57:46.844803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:11:23.775843Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:3e15296d670599a4f7a5434a9e0cfbd4fc1784d452a5f9e613fc06a80d724e64","observation_id":"6e9872b8-fd74-45a5-9b40-e0927155b269","resolution":{"observed_at":"2026-05-20T12:13:16.104340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:39.848194Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:54fc4155894d15b009fd1faa36bcaf406039877b6f1f6443af14c4d845551545","observation_id":"ea38ffc0-0870-4c71-a473-9bb34a44d38b","resolution":{"observed_at":"2026-05-22T09:21:21.445174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.21295","last_updated":"2026-05-20T15:25:46Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T15:25:46Z","title":"TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T06:09:44.172188Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.21295"},"observation_digest":"sha256:1fb5cf87fa1fda7ea30e87992fe57a7d30383f52b9c35a6d8b9a71e568178ace","observation_id":"385c5967-c3f6-471e-b7b9-801c40ae247b","resolution":{"observed_at":"2026-05-21T06:13:59.541184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.24547","last_updated":"2026-05-23T12:28:14Z","snapshot_observed_at":"2026-08-08T08:26:46.639382Z","submitted_at":"2026-05-23T12:28:14Z","title":"RL with Learnable Textual Feedback: A Bilevel Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T14:36:31.047856Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.24547"},"observation_digest":"sha256:c02112818b24bb57f38d2cc2413024d88cece2f1f4f00054ff6b6df30e517dc8","observation_id":"501dfa38-bae4-4d24-adb8-4753e01e0e59","resolution":{"observed_at":"2026-06-30T14:44:45.389511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.25603","last_updated":"2026-05-25T08:54:55Z","snapshot_observed_at":"2026-08-10T09:24:29.678831Z","submitted_at":"2026-05-25T08:54:55Z","title":"Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T21:47:17.894881Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.25603"},"observation_digest":"sha256:09a42ffdffb10819864d686b3bed5b57bf0dcd19901c619edfb5f62ea766fb14","observation_id":"42e53109-e362-4219-a074-f2e066a92577","resolution":{"observed_at":"2026-06-29T21:53:59.515085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.28631","last_updated":"2026-05-27T15:38:09Z","snapshot_observed_at":"2026-07-06T23:38:09.179597Z","submitted_at":"2026-05-27T15:38:09Z","title":"Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T14:08:40.968105Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.28631"},"observation_digest":"sha256:3dc0897e093078875285ab1e20d06ca3c038d91095f6a63392a88f8991fd4955","observation_id":"aa53460f-d11c-4698-a351-66cd561626f2","resolution":{"observed_at":"2026-06-29T14:13:30.091451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.29421","last_updated":"2026-05-28T06:14:49Z","snapshot_observed_at":"2026-08-09T10:08:12.418291Z","submitted_at":"2026-05-28T06:14:49Z","title":"Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:02:27.359309Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.29421"},"observation_digest":"sha256:71dd2ba69be9df19b1acce139bd33b8830b7d0f29b7afa856a060e61fc8c6a09","observation_id":"be6dab5a-7f68-4565-b122-f32f9ef196e7","resolution":{"observed_at":"2026-06-29T08:03:13.854769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.31058","last_updated":"2026-05-29T09:29:32Z","snapshot_observed_at":"2026-08-04T04:33:32.255796Z","submitted_at":"2026-05-29T09:29:32Z","title":"Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:08:05.597810Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.31058"},"observation_digest":"sha256:a1b1ec6e8a93e73020621fe5d2d804de0b52842ac72d6e01c29297b25b2a8be0","observation_id":"0c0dcf0e-1c86-490f-b523-8b830b02350f","resolution":{"observed_at":"2026-06-28T23:12:47.130224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2605.31455","last_updated":"2026-05-29T15:49:13Z","snapshot_observed_at":"2026-08-06T06:42:59.945235Z","submitted_at":"2026-05-29T15:49:13Z","title":"DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:49.358792Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2605.31455"},"observation_digest":"sha256:a90f6dbd7976b50d019615b39fbd6b2e5d28025829b96a618e5e672c438830b5","observation_id":"d61e6317-f63a-4d56-9aaf-91f9163c9f3f","resolution":{"observed_at":"2026-06-28T23:22:47.446580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.00257","last_updated":"2026-05-29T18:42:06Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T18:42:06Z","title":"ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T22:54:53.415067Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.00257"},"observation_digest":"sha256:4c8fd481a7800a5ea7d30fb16506472affbe44561eedc7a83c31fae26fcdedb0","observation_id":"2da60c93-eec6-4ef7-8097-6a86456ffc7b","resolution":{"observed_at":"2026-07-01T19:16:00.826631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.01462","last_updated":"2026-05-31T21:46:52Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T21:46:52Z","title":"An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T16:45:33.046568Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.01462"},"observation_digest":"sha256:09eed6202cb4df626cfabb06bd1cb6a19d2a84c979b7e37c2791a5cfe5996266","observation_id":"3f073902-f3a6-4dff-82be-b1ab3471e0e4","resolution":{"observed_at":"2026-07-01T21:36:14.954767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.03577","last_updated":"2026-06-02T12:46:34Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:46:34Z","title":"Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:24.523702Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.03577"},"observation_digest":"sha256:a7e86a9de007fe6025a94e9ea646e81338deb014d09dfcdd4d905efaea9a6b46","observation_id":"e4db9203-f400-4198-ba53-7fb855936f39","resolution":{"observed_at":"2026-07-02T02:36:27.134981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.04051","last_updated":"2026-06-02T09:02:14Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T09:02:14Z","title":"RUBAS: Rubric-Based Reinforcement Learning for Agent Safety","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:47.814115Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.04051"},"observation_digest":"sha256:fdd1b480c4da1b14c0894cb387c0d1ffa3ad81bc66d31c80c1730b614fe3c673","observation_id":"875eacab-6215-4ed2-9e69-9d0407c66210","resolution":{"observed_at":"2026-07-02T02:16:26.545699Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.04503","last_updated":"2026-06-03T06:34:42Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:34:42Z","title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T06:55:09.927034Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.04503"},"observation_digest":"sha256:711dbc0110c00ef7d47073454c0378cc7b019e8639c0fef3365f6ecb6b4f1468","observation_id":"8bb9c31c-a77d-4bd1-81a7-27ba35b847db","resolution":{"observed_at":"2026-07-02T07:26:46.249936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:f4633e7928b999a41bb78061a8f1ea8f2987c93f16b682a129159907004268dc","observation_id":"ad98ace7-89ff-444b-ba3b-9b0823f72811","resolution":{"observed_at":"2026-07-02T06:06:40.860348Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:1dccea9e9786ad63bf04ec0bbcba8d39ae620f70a2e382b3567dc528ca5106e3","observation_id":"195d58b3-f851-4598-8de3-4768f6b75741","resolution":{"observed_at":"2026-07-02T12:06:56.454152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":271,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:6abf6f85c568fa184f893f1e619b9e8462cd2f8d525e33e2b41de075473681b9","observation_id":"74730984-bc4d-4a21-8f11-f8778707e8c8","resolution":{"observed_at":"2026-07-03T01:37:30.535790Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T11:29:29.541010Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-08T16:37:02.317008Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-02T11:29:29.541010Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.14502"},"observation_digest":"sha256:4a5df5c88e28e5bcb0e891a60f8b8cc1215c1430f23edc6e2905ab395bf9fea3","observation_id":"2fa2167b-67a9-4e62-8a36-4ad5e412a7b5","resolution":{"observed_at":"2026-08-02T11:29:29.541010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.17678","last_updated":"2026-06-16T08:45:24Z","snapshot_observed_at":"2026-08-09T21:46:38.793485Z","submitted_at":"2026-06-16T08:45:24Z","title":"See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T01:44:24.586195Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.17678"},"observation_digest":"sha256:21213879c4973860326b5c48262fc89d2f0a604e67473a0f96eb1160317befa7","observation_id":"9b71737c-66b1-497a-b21c-82bb7dd11b1b","resolution":{"observed_at":"2026-07-03T19:28:52.863616Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:4c1319308ce3ea188f8196278135d8da3759c4635fe12ab0847841ef3abcb464","observation_id":"2b53a7e4-1e48-4f8e-aabf-22a7877b44b3","resolution":{"observed_at":"2026-07-03T20:38:55.869950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.18844","last_updated":"2026-06-17T09:24:19Z","snapshot_observed_at":"2026-08-07T12:46:02.610951Z","submitted_at":"2026-06-17T09:24:19Z","title":"Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T21:30:30.336251Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.18844"},"observation_digest":"sha256:ba59adcc0b917da9b74767cc6ec9e322eec62881073cad0610bdc3d2dd905280","observation_id":"a0e97a9f-e319-40a3-9b8d-541ea2f15184","resolution":{"observed_at":"2026-07-04T00:09:14.091061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.19120","last_updated":"2026-06-19T10:05:34Z","snapshot_observed_at":"2026-08-07T11:37:51.875076Z","submitted_at":"2026-06-17T14:33:38Z","title":"Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T21:12:26.064012Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.19120"},"observation_digest":"sha256:769dc7758ab9ca55cb41b03d01ff1db93189539c9c9fcc61d7f9b21f5fae5a50","observation_id":"4e67d117-1fec-4793-9a39-d6b064b6e480","resolution":{"observed_at":"2026-07-04T00:29:15.777562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:c766d133c3fa2fb29470a85b86b9c00bc5fb8b9b046a0619cf80938ab0887526","observation_id":"4592c602-423d-4e8b-ac5d-c0dcdd8719ef","resolution":{"observed_at":"2026-07-04T08:09:40.646504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.23104","last_updated":"2026-06-22T09:46:35Z","snapshot_observed_at":"2026-08-08T11:18:33.868763Z","submitted_at":"2026-06-22T09:46:35Z","title":"ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-26T09:05:36.937295Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.23104"},"observation_digest":"sha256:29f711f3ffeebbffe4eefb9e404253bc91fb9b4f60231979cec365250b89e955","observation_id":"5d64ef3b-3bae-482f-8f5a-2ea59e43cdd5","resolution":{"observed_at":"2026-07-04T10:09:45.128946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-05T01:24:53.186762Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:10a06b078ac443b9124e3003ad622476888b2ef628130aab1e4fb8f573bcb85b","observation_id":"cf8f9fac-b21d-42c9-9ea3-1245d14be7bc","resolution":{"observed_at":"2026-07-04T10:39:45.365913Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:335d2a705eefac01f007360d7521d43d9182d41b7cff0c0684af2eff78c6bbe3","observation_id":"4bcd50ff-c2a1-4cbd-a5f9-ab7fe76b7ae7","resolution":{"observed_at":"2026-07-04T16:19:57.755265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:6f720006cdafb176f98b7527273ea2fb385569f42d5fc594450bc1889f5089ec","observation_id":"6395ed83-137f-43e6-ba83-af5a45b904f4","resolution":{"observed_at":"2026-06-30T12:44:40.152604Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.31800","last_updated":"2026-06-30T15:19:26Z","snapshot_observed_at":"2026-08-08T04:58:46.001348Z","submitted_at":"2026-06-30T15:19:26Z","title":"Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:37.578632Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.31800"},"observation_digest":"sha256:f1713f69c0c9c7bdf65826ef89e3672bbc1446a4e9c97db6166011ff05120ee4","observation_id":"a9dd725b-7137-4538-b79b-8bc1416704ef","resolution":{"observed_at":"2026-07-01T10:25:41.162175Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-11T11:58:14.396969Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base LLMs.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04884","last_updated":"2026-08-06T10:55:17Z","snapshot_observed_at":"2026-08-09T23:09:51.531854Z","submitted_at":"2026-07-06T10:06:05Z","title":"HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T11:58:14.396969Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.04884"},"observation_digest":"sha256:240a4143bdb26e38046017512bcc1e608f247f5ed61b70e61f8f9bcb7f4999f0","observation_id":"160329a2-0799-4988-9f09-815b43d1694f","resolution":{"observed_at":"2026-07-11T11:58:14.396969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2607.07779","last_updated":"2026-07-08T17:46:36Z","snapshot_observed_at":"2026-07-12T23:17:59.879344Z","submitted_at":"2026-07-08T17:46:36Z","title":"From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier","version":1},"reference_index":249,"source":"pdf_text","source_observed_at":"2026-07-10T18:16:31.176239Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.07779"},"observation_digest":"sha256:c1703f130672054da6e590ad7a714f0501ac4095cf98b3fb91d2ed9239f1d842","observation_id":"15d9a061-9375-45f8-9d03-7f72e2f173fb","resolution":{"observed_at":"2026-07-10T18:17:33.858859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-13T04:38:11.219373Z","title":"arXiv preprint arXiv:2506.14245 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09217","last_updated":"2026-07-10T09:07:12Z","snapshot_observed_at":"2026-08-07T23:35:50.496696Z","submitted_at":"2026-07-10T09:07:12Z","title":"OpenProver: Agentic and Interactive Theorem Proving with Lean 4","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T04:38:11.219373Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.09217"},"observation_digest":"sha256:069c4e921bab75eb379d95290cc8f70ae187d4166a93ee02ae270ed96ba85c0e","observation_id":"a3c556d4-8710-45e5-8b1c-d7bf522a8c8a","resolution":{"observed_at":"2026-07-13T04:38:11.219373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-07-13T07:16:50Z","snapshot_observed_at":"2026-07-16T23:19:14.481825Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":263,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:4dfe6548c0342ca7ea85a08c4140326032018c5b69985d6069d21aa60b2fbf46","observation_id":"2eb0d7ae-ad35-43ee-96db-33d83135d706","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-14T03:48:31.314623Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11696","last_updated":"2026-07-13T15:29:24Z","snapshot_observed_at":"2026-08-03T00:28:12.685505Z","submitted_at":"2026-07-13T15:29:24Z","title":"Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T03:48:31.314623Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.11696"},"observation_digest":"sha256:87556e51c1e37f7a1ab8928182d24a5b040df7bb9586f869bace56a10b37fe3e","observation_id":"9ea837e8-8479-47c6-b016-841b48f2eb7a","resolution":{"observed_at":"2026-07-14T03:48:31.314623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T14:50:16.901566Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-06T07:49:27.049032Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:16.901566Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:43ee9938abe4b7a3acb8f01d0c9e6183f34fed58e10f34f6c4936a874b527694","observation_id":"971d7c0f-ea51-4964-9eb0-fd15aeb544a9","resolution":{"observed_at":"2026-08-02T14:50:16.901566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T14:39:41.442301Z","title":"arXiv:2506.14245 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16206","last_updated":"2026-05-08T12:29:23Z","snapshot_observed_at":"2026-08-08T19:30:46.291541Z","submitted_at":"2026-05-08T12:29:23Z","title":"PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.442301Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.16206"},"observation_digest":"sha256:7732e3d6a700e3b9255dc70d8575caeb7b238124830501e09af36db5db376abb","observation_id":"0f0e6076-2c99-483a-921b-6606026c0a5e","resolution":{"observed_at":"2026-08-02T14:39:41.442301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-01T17:54:29.191419Z","title":"arXiv preprint arXiv:2506.14245 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17479","last_updated":"2026-07-20T02:01:03Z","snapshot_observed_at":"2026-08-10T16:59:41.824087Z","submitted_at":"2026-07-20T02:01:03Z","title":"TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:54:29.191419Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.17479"},"observation_digest":"sha256:94259c987ce51257d0f4ce3b7274eec60dd17692968171b8b6369a09af4ad0b6","observation_id":"1c88179b-b75e-4a29-a01d-1511f31d0b37","resolution":{"observed_at":"2026-08-01T17:54:29.191419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-01T12:06:50.831758Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19691","last_updated":"2026-07-27T00:25:39Z","snapshot_observed_at":"2026-08-01T12:06:47.794527Z","submitted_at":"2026-07-22T02:45:08Z","title":"SLPO: Scaling Latent Reasoning via a Surrogate Policy","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:06:50.831758Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.19691"},"observation_digest":"sha256:ee8a20fea0d83b970f523c51b5ea66291db21d3f8d1455930ffbf684a8d2ca14","observation_id":"e7eeed5c-9805-4e0c-ba32-16f4e5399aac","resolution":{"observed_at":"2026-08-01T12:06:50.831758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T07:44:11.904578Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.904578Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d09857090b988e71762827342b625a07f256114f2415b9aeccea36817053ed52","observation_id":"2ccb2f31-6291-4be4-81d2-34523d9259e8","resolution":{"observed_at":"2026-08-02T07:44:11.904578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-01T03:02:07.807759Z","title":"Reinforcement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-10T14:39:39.683275Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:07.807759Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:fdcd280d6e963227227537d2c9e5a3092c305e3e8cfed8cd6a0c0421afbf6fcc","observation_id":"2f4202ad-7ff8-481b-9067-c516c9cb5121","resolution":{"observed_at":"2026-08-01T03:02:07.807759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-31T23:39:13.429089Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.429089Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:02620db0b323dfe005a8cf6399a8a0d7f36ac4015c71843800ea863ec73e2a96","observation_id":"e44d51b0-8ae4-4ad0-9230-592978058a1f","resolution":{"observed_at":"2026-07-31T23:39:13.429089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-31T18:34:16.348704Z","title":"arXiv preprint arXiv:2506.14245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28077","last_updated":"2026-07-30T11:50:10Z","snapshot_observed_at":"2026-08-08T18:44:48.984070Z","submitted_at":"2026-07-30T11:50:10Z","title":"LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T18:34:16.348704Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.28077"},"observation_digest":"sha256:d3cdca3b5d6f70fdf88034cb7569f7000788fe18fc19aeee3fe27ce8df2f7cbb","observation_id":"7df2fb86-6cf9-48a0-be5c-c82780243a82","resolution":{"observed_at":"2026-07-31T18:34:16.348704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-04T02:03:06.482231Z","title":"arXiv preprint arXiv:2506.14245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00019","last_updated":"2026-07-01T10:39:54Z","snapshot_observed_at":"2026-08-09T09:56:58.991511Z","submitted_at":"2026-07-01T10:39:54Z","title":"Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:06.482231Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2608.00019"},"observation_digest":"sha256:14123a3428985f9ddcec25c3368c64d206d68cc0f6be809d21b357ef3411580d","observation_id":"57cb7ae4-e6b9-4b1b-bdc4-76ccba8c7c9b","resolution":{"observed_at":"2026-08-04T02:03:06.482231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-08T17:17:53.443925Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05246","last_updated":"2026-08-05T15:11:06Z","snapshot_observed_at":"2026-08-09T23:36:56.759024Z","submitted_at":"2026-08-05T15:11:06Z","title":"LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T17:17:53.443925Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2608.05246"},"observation_digest":"sha256:61bfded05cf75978e2c620422d394fcb49601c77fa1a0242f2f3c96eb7331067","observation_id":"d7cabc12-5fd3-4ad5-9e9c-693f2d03cd75","resolution":{"observed_at":"2026-08-08T17:17:53.443925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14245/citation-record","integrity":"/paper/2506.14245/integrity","json":"/paper/2506.14245/citation-record.json","paper":"/paper/2506.14245"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-07T17:12:11.913580Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":"2503.08679","doi":"10.48550/arxiv.2503.08679","metadata_source":"pith","pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-thought reasoning in the wild is not always faithful.arXiv preprint:2503.08679","venue":"cs.AI","work_id":"221c289d-ba9c-41b9-a1d6-7ea026fdcc9b","year":2025},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:57f660ab56b9272ef7674eef309f90558e32da3f2128d18c66e189e332b5606f","observation_id":"7a17aa33-fcff-43ff-a872-6e30272278cc","resolution":{"observed_at":"2026-06-01T03:02:49.618587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:7abf65a8f76d0f20f9e0ef91b43f130c1e30d31de6d39d63392ecae648218661","observation_id":"0adda03e-aaa3-4f17-9821-0de309ce15c0","resolution":{"observed_at":"2026-05-13T12:44:27.787791Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:c8f2323b169b44e3f30e0dfb0f0f3226a287c554e7f1a25f249e968ebab8d355","observation_id":"795ebf42-5265-4b53-9011-6cfc92740d34","resolution":{"observed_at":"2026-05-13T12:44:27.790554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ac5f33bd-a3a5-4b5c-92a6-8c342c0815a5","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:dfe16cb52c34e21cc6fdbeafeea9ded8fc8af0a836ea6202bd7f73ce7a17be6e","observation_id":"e2883e1e-efb1-48f4-90f8-43236ee1a0f5","resolution":{"observed_at":"2026-05-13T12:44:27.792652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clas- sify them into the following categories (if applicable): - **Calculation Error**: Mistakes in arithmetic, algebraic manipulation, or numerical computation","venue":null,"work_id":"b70162f6-2d74-4796-aa6c-23511b08ce1a","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:b286b7cac8553574bab1a327e2c41a9a67c9c12360fb5130012523100f8bf434","observation_id":"5f272f10-a7ba-463b-b59d-c1f1e7b57e98","resolution":{"observed_at":"2026-05-13T12:44:27.795018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"unideal case","venue":null,"work_id":"c7aa2502-272c-450c-81f3-2cfb69fdaef8","year":2025},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:4c1d4c0f526e79da01ae15e264cb5aba045b7add41f36c05bf79b3e7e9080fde","observation_id":"1d25eb30-e5e1-40a6-b95c-2dc798e76616","resolution":{"observed_at":"2026-05-13T12:44:27.796840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf5c7c80-dd0b-4282-b975-33c596ad5cb4","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:40836508f1562297d1e134296ee4e3781fe520b2d7085bae7b12afa52bca98f6","observation_id":"87c3b3a5-2075-4791-9ddd-c9a9e968da19","resolution":{"observed_at":"2026-05-13T12:44:27.799090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"93f96174-c4a3-492a-bf4f-275c24d7150d","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:773ed78fda327809509ce657cbdc8c9707197ef37e3779f2a2775c070fc60f46","observation_id":"1b19361c-1b56-417e-a1eb-152206b607bd","resolution":{"observed_at":"2026-05-13T12:44:27.801141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8b3e1ba2-68b0-4282-aafb-d3b553d150f1","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:30c1bd1c8f2c04199f530adc69e3284c8457ba91bce95e27d4be592018a4e3db","observation_id":"e20cefe5-ceab-4a7e-85b3-e80ddb853411","resolution":{"observed_at":"2026-05-13T12:44:27.803305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d1657508-541a-4faf-9500-3e0e5bdb1714","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:3fc7577a8087bb8b340527505878e6d8da7b24b70113b18558ac3eeac77df678","observation_id":"09412fc5-719c-4de9-94db-2a383e178685","resolution":{"observed_at":"2026-05-13T12:44:27.805028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"755f3cc5-85be-46ff-9b5e-fabe9d5d6b07","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:7ee36d9d3d3794cb912abb994f1c52cff0997577fbdc013f7d506d4316cbe489","observation_id":"d526927e-4834-41c1-bfee-9b5eeee96687","resolution":{"observed_at":"2026-05-13T12:44:27.807099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7eea1edb-a8f1-44da-bc3b-dec37b9f1497","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:2590d043e96b457b662447d18175c7497220475ffaedf87e6e9f48380e9900cf","observation_id":"85840522-6502-4e21-91a9-ff09888f1da6","resolution":{"observed_at":"2026-05-13T12:44:27.808830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This distance can be written in the form m√n p , wherem,n, andpare positive integers,mandpare relatively prime, andn is not divisible by the square of any prime","venue":null,"work_id":"0a3d4506-d8ef-4088-b7b5-c2b340b7a23d","year":2025},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:9838520d5bd61bdc38168e9b901a8f81ee82afd1896ec1b5ab7dc8021c55dbcc","observation_id":"c090d2ba-3d59-42ef-b97e-bfb1ddf7cd43","resolution":{"observed_at":"2026-05-13T12:44:27.811046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1d66497d-9ff7-43ed-9c6d-276ac789fe3d","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:7248e56c1681e58b43cb6ea50b9affe369e851866bc8c690aba9177194f578cb","observation_id":"d14f7b43-69e3-4837-9229-6bbc04583f5b","resolution":{"observed_at":"2026-05-13T12:44:27.812573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-R1-0528-Qwen3-8B verify: The area calculation for triangle MNE uses DE + EG as a base, which is not a valid base unless DE and EG are collinear","venue":null,"work_id":"5e75832f-7a51-42d4-8953-edc140538c44","year":2023},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:e33349f5ba818e4cfa7a21fb988eb23387cc015b03bbb20a7bb595dfba8491b8","observation_id":"33efeb71-c8c3-4231-b61d-9c1cd6355450","resolution":{"observed_at":"2026-05-13T12:44:27.814556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-R1-0528-Qwen3-8B verify: - **Omission / Incompleteness** - The so- lution does not provide a complete justification for why the point (1, -1) gives the maximum value","venue":null,"work_id":"3f1baf07-890b-4e80-b0f8-4ab07a98a8d3","year":null},"citing_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T12:44:27.769465Z"},"links":{"citing_paper":"/paper/2506.14245"},"observation_digest":"sha256:d2bd222bbe5409b74ce7b0e3635146aab83a53ec2d2c1643982711f582887c4e","observation_id":"a477e74d-705c-4c47-89b4-e430c0beb7a7","resolution":{"observed_at":"2026-05-13T12:44:27.816322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 86 inbound Pith citation observations for arXiv:2506.14245."}