{"as_of":"2026-08-09T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:721c755054253cd8a8aa5b39da6ba43f61126cdae120def4965c521585b060cb","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:26.418982Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:41.900632Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:06:40.819064Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T21:21:41.900632Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.900632Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:112971edc01b1197b82d659943581b7bf1952fd90726e5e6a3ab1d82e2f0dcda","observation_id":"2c78ad0a-163e-4860-87d2-2b82f402346b","resolution":{"observed_at":"2026-08-06T21:21:41.900632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T20:26:46.857127Z","title":"David JC MacKay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.857127Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:a0c8d1e80ecd77273ce5ead7b5caab170af4e55ee5eaad245ac6c32fbbab9392","observation_id":"c1e0f7d7-0436-40f6-9d38-34d50fec9880","resolution":{"observed_at":"2026-08-06T20:26:46.857127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-05T14:35:50.973056Z","title":"Ang Lv, Ruobing Xie, Xingwu Sun, Zhanhui Kang, and Rui Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.973056Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:1b5de5e91d8d7df46a4865d4d5b79893679f97dac3146f9f7c66739669c04cd4","observation_id":"44a3cdc7-cb6d-4f98-8329-29478b16b20e","resolution":{"observed_at":"2026-08-05T14:35:50.973056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:e73aa5b058bf868b5cfcdf73599606e6a7e2135d95e588ab9b486c0232b038d0","observation_id":"108954cf-c305-4ec2-8327-6849d809a05d","resolution":{"observed_at":"2026-05-10T23:45:53.070918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-08T15:48:00.731292Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:e5f845e3305ff9816e798f18db435674ca6af42dd4886c2bd09fd64efec10689","observation_id":"8ebcca75-35d3-4ee1-87a0-82b75a9e79f3","resolution":{"observed_at":"2026-05-11T04:00:55.164977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:136da289790a6621952feb532fe973b7cb56c582265ed47f5a75c43da4e6e80b","observation_id":"b8673b48-961e-4c8e-a55e-11795d86cadd","resolution":{"observed_at":"2026-07-01T20:56:13.695124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:a57a1549909747b6b780c9074ec92b9c05a10251638bbc0386baa5e5e342f891","observation_id":"7a0e6b5b-8f8d-4cde-9b40-2fdff5e0c9b4","resolution":{"observed_at":"2026-07-02T06:06:40.820599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22653/citation-record","integrity":"/paper/2505.22653/integrity","json":"/paper/2505.22653/citation-record.json","paper":"/paper/2505.22653"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:20.774171Z","title":"Rethinking reflection in pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.774171Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:2400ba758fb8b46f9c89ca38a05c412d504bd94920274d4a9c26d59547bf2ce4","observation_id":"336360d1-d394-4743-b0ae-7be6a657ddb8","resolution":{"observed_at":"2026-08-07T13:08:20.774171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:30.015309Z","title":"Math- arena: Evaluating llms on uncontaminated math competitions, February 2025","venue":null,"work_id":"8efe7d89-3534-4303-8241-30c3a838ffa6","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.882511Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c0166ef692df65fadcd7ebab315c36c24a202ef1ed39ffdd4643fad7705d6445","observation_id":"cfee5b61-bfa2-41b1-8ec9-ebeaef0ecf13","resolution":{"observed_at":"2026-08-07T13:08:30.141674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:20.971903Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.971903Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:47c421593ae645ea5ba46647283c7d29ceda5071243c99c833748ff0206ec2f9","observation_id":"998bfda0-0c08-46be-aa8c-b9ec8d061431","resolution":{"observed_at":"2026-08-07T13:08:20.971903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.696547Z","title":"The accuracy paradox in RLHF: When better reward models don‘t yield better language models","venue":null,"work_id":"34f8e887-0568-4fae-b183-e1a3540b44d7","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.046797Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:d6623a6d0fc6c66f2bb4f99430e9ac844c02d3af2d23a9799ccb9b44cf0969bf","observation_id":"dd4d2aa7-3ebd-4178-84e4-761d8bc8e0d7","resolution":{"observed_at":"2026-08-07T13:08:29.793026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.514602Z","title":"Fortify the shortest stave in attention: Enhancing context awareness of large language models for effective tool use","venue":null,"work_id":"1f6eff2a-ab69-4974-a825-1c2a6a1ef905","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.149444Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c7f65c3779c041860e3dca640733eaeac39dae266f6d7bc309598cf7217eb65f","observation_id":"5cc1211e-9c9b-4cbe-a5b8-4b980717d800","resolution":{"observed_at":"2026-08-07T13:08:29.579980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:21.245093Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.245093Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:5935688e875de6f95942e599db29d0ef53f1a0f3d6faca89ae28444b354ed947","observation_id":"fa6a6ec4-aa68-44e1-ae75-ea2c1ad58338","resolution":{"observed_at":"2026-08-07T13:08:21.245093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.393341Z","title":"Q*: Improving multi-step reasoning for LLMs with deliberative planning, 2024","venue":null,"work_id":"3f02ca3d-925a-4118-a5cf-ba3353301eaf","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.723778Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:9da21a4cdad296bc14246bab93e4303b7bead588bfce5584ae9a4573bc141ab0","observation_id":"2fbaa476-27b7-4e7f-a4ab-9f973e655974","resolution":{"observed_at":"2026-08-07T13:08:29.438633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.275125Z","title":"Fleiss et al","venue":null,"work_id":"0a34d256-73f2-4379-8590-e8c5b1829ff9","year":1971},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.439678Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:d6ff8f2ec72ab554ad7028ae02e8418ecb6bf18c54c53f9690235fc7c6b14670","observation_id":"3881cd0d-3e5b-43ba-989f-bbf78fe41ef5","resolution":{"observed_at":"2026-08-07T13:08:29.324041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.098944Z","title":"Angelopoulos, Jiantao Jiao, Banghua Zhu, Joseph E","venue":null,"work_id":"b628002a-cde5-4648-8766-002843b4547a","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.712573Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:a258b3c7b87bb180d4b22f347d3a36208f7456d1461cc85ab822e5c34cb3c3ac","observation_id":"2bca5e9a-1439-47f8-aaf6-7f87adf5a74b","resolution":{"observed_at":"2026-08-07T13:08:29.144749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:22.798068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.798068Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:09189de1e78e9ffce589e911438e0dccec9ffb26a338c311a74c3e6dc48fdc3a","observation_id":"64d7804c-fb4f-41bd-872c-ca23e7ddd1b6","resolution":{"observed_at":"2026-08-07T13:08:22.798068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.873630Z","title":"Training large language models to reason in a continuous latent space, 2024","venue":null,"work_id":"74b4eb67-5e7b-4830-ac06-7f9165f29126","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.889241Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c6c9d2f52e1ba8d05399d599c051b6e93f26b7d563b5fc12be7f71d32b70bedf","observation_id":"bd96b21b-2804-4f67-adb6-7cb18f974884","resolution":{"observed_at":"2026-08-07T13:08:28.939096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:22.944756Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.944756Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:005b3ee79c6efb8db182247c4cae42dbccdaba2da92832aa37e697de65808874","observation_id":"635020b9-ad11-4fdd-af1a-d3fb2e407619","resolution":{"observed_at":"2026-08-07T13:08:22.944756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.015073Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.015073Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:b9621aa40e55ec021e218c3cf229b36a6463f491ccbd5b555daf377fea473eef","observation_id":"ee38baa9-bbe4-4dfd-88bb-1f454b229ffb","resolution":{"observed_at":"2026-08-07T13:08:23.015073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.664792Z","title":"Human-centric dialog training via offline reinforcement learning","venue":null,"work_id":"5d52306c-31a6-4097-b977-46a4639a30a3","year":2020},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.127945Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1a38c84688142a0ff7ccb6a599eb8e5819203bf50346ad95a092fc2f543bb883","observation_id":"378ba01a-8ced-4322-ad0c-92e08e401e32","resolution":{"observed_at":"2026-08-07T13:08:28.733015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.421174Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":"ca3ffdec-3f77-4e17-b5ba-f656cf522d41","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.187072Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c51ea6a7d3cc8a41520666d98dd79c5600749a625e30a8826893f5e07b032b23","observation_id":"cca45cb9-7636-447b-b605-72d834896154","resolution":{"observed_at":"2026-08-07T13:08:28.526514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.236073Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms, 2024","venue":null,"work_id":"9af5f3a4-5b27-4029-9146-90330ce6a446","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.332664Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1237274cb59996756812fa48fbefff541aac04d8033da6f915de26d5c25ae3e6","observation_id":"a2855bad-a891-4e71-8de2-9b2da73099ff","resolution":{"observed_at":"2026-08-07T13:08:28.347936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.476989Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.476989Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:769cc72ed6b7ab4fbf88a147614016b859d2bded13bad3097ecb4316bc01c0e7","observation_id":"9c252d4a-6eba-44fc-8507-e4a48c7916b7","resolution":{"observed_at":"2026-08-07T13:08:23.476989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.974339Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":"e145bf1f-31a3-4a4f-8b84-b7dbaeba5248","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.564975Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:ce1af6c2acfb6fdfffb18e2539724c31e352bbdbde9224bfd42ba91501c0c417","observation_id":"14cce726-7ded-4d3d-8c40-62737ca8a218","resolution":{"observed_at":"2026-08-07T13:08:28.032968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.664904Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.664904Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:2174c29b978e8e92c2970bd184e379ab062fd5b994318bb07de4fc8562e101b1","observation_id":"8f5711fa-ead4-4460-b00e-d306e59b5d64","resolution":{"observed_at":"2026-08-07T13:08:23.664904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.784375Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.784375Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:2af07bff68ed55307542705c1163065502791b4c17bcf6e593e03d509e1e4095","observation_id":"08f18d02-a882-4f7a-be83-c2d6097de2ab","resolution":{"observed_at":"2026-08-07T13:08:23.784375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.224696Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.224696Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:4aa4c50475c2b20d074e5ecd5ffe00e97e02546858f90f6e9a089bf97cc90be9","observation_id":"69dee594-ee21-4766-be72-8080c5d2b93d","resolution":{"observed_at":"2026-08-07T13:08:24.224696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.363161Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.363161Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:ef1f757a916f81bd18f8c328ce042dc140ee6249180faff15244921a263e0d94","observation_id":"10d11159-eb51-492b-9e73-18ce08a42abe","resolution":{"observed_at":"2026-08-07T13:08:24.363161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.515080Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.515080Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:81ddfdb3155f02a6f94e170a83fee056cffea17357b4d5e97c83dc53f5fe3832","observation_id":"59acf32a-c8fb-4bb1-ae9e-927664cdeaf9","resolution":{"observed_at":"2026-08-07T13:08:24.515080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.564768Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":"d2cd5ba4-4272-467f-a79a-6c18b85adc4e","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.675041Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:777c18e52309d400f2d55e5eed5c0797177c622ca56c973aeb776a097f9112c2","observation_id":"7d818213-3f27-4f53-bf0e-9dcb03f1d974","resolution":{"observed_at":"2026-08-07T13:08:27.645811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.812651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.812651Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:9328d4fa7b85dc690797ff259b57eb69a786dfca1e9c3fcb450dc480d4f381c5","observation_id":"f037cab5-2d76-46dc-a77e-88e8f44d0696","resolution":{"observed_at":"2026-08-07T13:08:24.812651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.984971Z","title":"High- dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.984971Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:2a0144ff2aed4cb2bad735778d68efc9ded1cc68f5a6c63545ba7dda12ce30e6","observation_id":"9181ac7a-da72-464e-939f-190848bf5bc9","resolution":{"observed_at":"2026-08-07T13:08:24.984971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.215091Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.215091Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:d07c70ae146869f33bf4fbf34ba09293e486f5379119fed13286dd2f8a1731a4","observation_id":"11c5364e-0c72-46a3-aeb0-994d299d28bb","resolution":{"observed_at":"2026-08-07T13:08:25.215091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T13:08:25.364234Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.364234Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:33cf7dc661a2b590f25a69b0ebfadebef40964a3ab6216c3562946449de4a49b","observation_id":"f7c7bc53-22d7-49cc-9177-88a313d57cbe","resolution":{"observed_at":"2026-08-07T13:08:25.364234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.504871Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.504871Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:22aa1b95c917985c43b45599adc02e893ec8ff4467950523ba3a94356d5454bb","observation_id":"4272dc37-bbc5-4ce1-aef3-aed663720f48","resolution":{"observed_at":"2026-08-07T13:08:25.504871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.243501Z","title":"Dedicated feedback and edit models empower inference- time scaling for open-ended general-domain tasks, 2025","venue":null,"work_id":"5cfcd3b9-2320-4c8e-8a8a-7156b4bf4bde","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.654842Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:f2ef6224d235cef8f004d2951c6718624f91b8a0afe544ab68c0bef56146d0f5","observation_id":"26abeed2-a18d-420c-9afd-e7d1a79adca9","resolution":{"observed_at":"2026-08-07T13:08:27.328579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.150606Z","title":"Rethinking reward model evaluation: Are we barking up the wrong tree? InThe Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"87a1159f-a1b1-405b-acae-387b8927eb9d","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.754909Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:a8360ffa1463041f069467935a433582253a54ec0321bcdd8925b5328ecaef9e","observation_id":"7b6fdd6e-43c2-4eb5-ae7c-4740d996a3fd","resolution":{"observed_at":"2026-08-07T13:08:27.187371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:08:25.864911Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.864911Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:e9fa1de6726b935504973836dd9f4b47da5a34021ee79cb45158260f720ce11d","observation_id":"bea22113-c115-4ecd-812f-1e937335b71a","resolution":{"observed_at":"2026-08-07T13:08:25.864911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.962237Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.962237Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:7fcfce5f99902e6bec5c003a48041bf698a7c7290187be2dcf2c1063856096c0","observation_id":"ea6018df-d49a-4ef0-bbf8-b858be14404c","resolution":{"observed_at":"2026-08-07T13:08:25.962237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.027884Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.027884Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1c92ea63aa8cb5804ae6cf21a78ae27c8c5f0d9b29e457db4e9bd614532bf43f","observation_id":"a4b3b8f4-9604-4a7b-b586-b5d512a31f90","resolution":{"observed_at":"2026-08-07T13:08:26.027884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.063576Z","title":"ReST- MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.063576Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:6cbe56ce93e76d9dc4da9084e5e9e026a5465a3ba27972b01c1f75ff89c76a2e","observation_id":"9eb3e823-7347-465f-93b5-749aa9c69481","resolution":{"observed_at":"2026-08-07T13:08:26.063576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.918665Z","title":"Found in the middle: How language models use long contexts better via plug-and-play positional encoding, 2024","venue":null,"work_id":"d447d0d4-48b5-4b8b-883d-854fddb80f1e","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.156253Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:96c32515f6fa8cda103b1fae50201e396dc3f41acacb420a12af92e285f4240a","observation_id":"7f4098c4-46f3-4d53-a169-68d533074504","resolution":{"observed_at":"2026-08-07T13:08:27.018577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.805467Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment, 2025","venue":null,"work_id":"4f0c0e6e-8dd3-407d-ab5e-3652cfb2fd6b","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.285176Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1d980c6e60696a56f7495a36848bd233a8513e874497587d6b002f590ab3c690","observation_id":"1396fc1a-f01e-4061-8aa8-07a35ce0d174","resolution":{"observed_at":"2026-08-07T13:08:26.853533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.574279Z","title":"Assistant:␣<think>","venue":null,"work_id":"653dc899-d411-4421-aaf8-77fceda89015","year":2023},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.418982Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:f0e77d8bf44d81877cce3b196307c7cec873974e4d1225661e0712bad85c6b15","observation_id":"a4ece631-7ac0-429d-88eb-33ba21a03c33","resolution":{"observed_at":"2026-08-07T13:08:26.655809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 7 inbound Pith citation observations for arXiv:2505.22653."}