{"as_of":"2026-08-08T20:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d68dfc728a92cc5cdf0c4a2d6c02c621781f442ab15dc96374757b9c5753bd26","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:38:50.332584Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:32:55.155806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:47:28.400784Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-08-05T23:32:55.155806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05282","last_updated":"2026-07-21T08:08:53Z","snapshot_observed_at":"2026-08-05T23:32:54.202480Z","submitted_at":"2025-08-07T11:26:40Z","title":"Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T23:32:55.155806Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2508.05282"},"observation_digest":"sha256:90569c67e2d318df0f35bb374a98735331a162b55c9a1c7c913dacf82cf6a6e7","observation_id":"4bdfda50-1c54-4dda-9721-25b4f9f42947","resolution":{"observed_at":"2026-08-05T23:32:55.155806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2604.02341","last_updated":"2026-02-08T06:38:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-08T06:38:20Z","title":"LLM Reasoning with Process Rewards for Outcome-Guided Steps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T06:43:19.869111Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2604.02341"},"observation_digest":"sha256:f5171ab69e0dc5f6167775527e70bcb106bff466c508c1fb35ef26957d3703d5","observation_id":"7e729a3c-92e4-4d7c-a159-81f0384848bf","resolution":{"observed_at":"2026-05-16T06:47:28.403595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.04064","last_updated":"2026-04-10T21:13:46Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T21:13:46Z","title":"Improving Medical VQA through Trajectory-Aware Process Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:18:17.846140Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.04064"},"observation_digest":"sha256:31fd9550786e126ea50e3024f82f7daa06abb2f2bca1ffc8502308f84a462069","observation_id":"fe7a82cc-eca3-4c9f-bacd-f3766a158e7b","resolution":{"observed_at":"2026-05-11T07:06:06.051115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:162f507ec684c0d702b519afa28737f94fcc63fc48c7f3340b4a376034eca2db","observation_id":"16ffdba1-42f0-4c17-8c90-bd1ee5a4ba35","resolution":{"observed_at":"2026-05-10T06:26:27.809955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-03T01:46:31.336725Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:6da87c73edf6eaf8b1a9be5f15f03e1e49e154c3556dda36d7728293837181dc","observation_id":"e49ff7ad-a288-4b99-92e4-8b31bf123d1c","resolution":{"observed_at":"2026-05-14T19:22:50.477238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14391/citation-record","integrity":"/paper/2505.14391/integrity","json":"/paper/2505.14391/citation-record.json","paper":"/paper/2505.14391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.491408Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.491408Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:8560d6148f3e89165f6352c58c7ab9495347c2c5f432988920bfb3d283026822","observation_id":"56ea353b-2cf6-437e-a849-016d3e2fb7b9","resolution":{"observed_at":"2026-08-07T15:38:45.491408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.646682Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.646682Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:c60bf0bb8fe79f6a253122e01a67dfb55f370574694511302c4015934a2d3b5f","observation_id":"5ba3d376-3125-4cb4-bef0-b951c523e66b","resolution":{"observed_at":"2026-08-07T15:38:45.646682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:38:45.810278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.810278Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:5fb3d446d7acdcc8d66cabb9e538fd8b556e45dab8df19eb29fcd023691e9517","observation_id":"99ca64c4-e157-473c-9c38-c563923aad0b","resolution":{"observed_at":"2026-08-07T15:38:45.810278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-07T15:38:45.934365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.934365Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:d5822af5a74a495b97cb57556f1824b2e08f1eb562d879f1f549cf2c80354f5f","observation_id":"e6f6a7e9-f55a-4881-9803-c1929b3d812e","resolution":{"observed_at":"2026-08-07T15:38:45.934365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:38:46.053508Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.053508Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:3e4c05956f3d54666293f1df9e6f905def20766202698f8f6edab73f44f0d609","observation_id":"2913f427-467c-4a51-9ead-0fd50fbf8d14","resolution":{"observed_at":"2026-08-07T15:38:46.053508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:38:46.198208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.198208Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:7b78783fcc89c5016186bf7f1eb0a01ea8d44d4ecdaa26fff4c88cba2163e4db","observation_id":"60664621-518a-454d-9e7e-1498e3ce7270","resolution":{"observed_at":"2026-08-07T15:38:46.198208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T15:38:46.337373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.337373Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:8bba9c17b2dbce6063b929d33934142c9297a2241372eae8280aa865cbd7830e","observation_id":"a605f1c9-900b-4e70-878d-96b1991697b1","resolution":{"observed_at":"2026-08-07T15:38:46.337373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:38:46.503915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.503915Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:87bc60fddd3b6e0a2466dfbb2165af06f49598da7d94d4429a85843d7f00cc20","observation_id":"06c8340c-dd92-4d0b-98e8-fbecc9948eeb","resolution":{"observed_at":"2026-08-07T15:38:46.503915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:38:46.642136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.642136Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:b44c1a626560a5737792f2b8e489fae87ef6ca383bcfb009a2d1cf398971504f","observation_id":"c1bbf3ff-8196-4307-b5f3-6b2c0075e88a","resolution":{"observed_at":"2026-08-07T15:38:46.642136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:38:46.750931Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.750931Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:5221022d24ae1a9b390ce9792065576652646011aa1dff204dfc9cfa4abb579f","observation_id":"16e8b4a0-21bc-41e3-a6cc-843eb4a2c98c","resolution":{"observed_at":"2026-08-07T15:38:46.750931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.889283Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.889283Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:fe6a314d752d1a44f877815fe5be25afdce9c04ca7e0f26e54ce88c85c863ac1","observation_id":"1dbca456-136a-40dc-9da3-d3c8609eb920","resolution":{"observed_at":"2026-08-07T15:38:46.889283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T15:38:47.040946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.040946Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:dd4901e2f98403e75d85539404557bc1da374aecdd08c98d477859310d50135d","observation_id":"6a2055b3-5ad8-4212-9f18-dd114fb85d6a","resolution":{"observed_at":"2026-08-07T15:38:47.040946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T15:38:47.152880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.152880Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:0084c7491e0fd079add0bfb0c544cc4acf282eeec77b0ab90e6f41d76f5573aa","observation_id":"4f78a47e-f84a-49b0-a976-e0dae7057545","resolution":{"observed_at":"2026-08-07T15:38:47.152880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09003","last_updated":"2024-12-16T06:13:03Z","snapshot_observed_at":"2026-07-06T17:16:38.221230Z","submitted_at":"2024-01-17T06:48:16Z","title":"Augmenting Math Word Problems via Iterative Question Composing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09003","snapshot_observed_at":"2026-08-07T15:38:47.312631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.312631Z"},"links":{"cited_paper":"/paper/2401.09003","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:eb5e187c6e9eed29e820e68973fe7d43b6588f87706ffec7cd0f4c9d27d28cf9","observation_id":"eb3f3a78-6ed7-4ae3-8649-6891effedeb9","resolution":{"observed_at":"2026-08-07T15:38:47.312631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.463728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.463728Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:f5df5ab38d279b7f14ff4893fd0f442f3ab581645d6b25ffe08811709648ea36","observation_id":"8a944585-18f4-4afa-b251-22318ae3ad1c","resolution":{"observed_at":"2026-08-07T15:38:47.463728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T15:38:47.611667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.611667Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:4b09c8a25f31cf7cc7af0bf3b01f3be6f17bfc5e745693fe4bbfb794a75e52bc","observation_id":"41a83954-97b4-4a1c-b509-692ce2a2caf9","resolution":{"observed_at":"2026-08-07T15:38:47.611667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.786178Z","title":null,"venue":null,"work_id":"38858aed-cc08-4ec8-b2f8-07e703a26193","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.742752Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:855c028406e2f985320e2ccbb02aaa1e66187cc9466d44528ff418874bab85ee","observation_id":"f06f3f27-1078-4c93-ab80-8998c3a269fd","resolution":{"observed_at":"2026-08-07T15:38:51.846806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:38:47.858019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.858019Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:db2af70c2e4ea0d316da3e95de51bbd52f3d6fdbdb20848d3cb5d8bf90ad5698","observation_id":"c24a8b09-f2c4-4ca0-bcaf-e6991b214e00","resolution":{"observed_at":"2026-08-07T15:38:47.858019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:38:47.943305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.943305Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:a346a10006581974c01dc71359908984f4de1074ef8e2c74641426b69d3a8080","observation_id":"5b37e09c-c8cb-43dd-b03e-b0f7df8d9fea","resolution":{"observed_at":"2026-08-07T15:38:47.943305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.144397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.144397Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:f6402a837e5937013fd82531c5f028ebc338b24c5f164b0ec0c64204bd322dd5","observation_id":"3acdf7a3-f627-4f9a-9956-ffd8bdd99dbb","resolution":{"observed_at":"2026-08-07T15:38:48.144397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.528188Z","title":null,"venue":null,"work_id":"e2a55f54-6ccc-45d6-a721-f35331fb97bb","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.277073Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:592908e03beb596b00deeb60e52593db6de2c770c15ae366046d767d96f71a4e","observation_id":"c5437f33-0c61-4f58-ad92-432aa0b5a7c4","resolution":{"observed_at":"2026-08-07T15:38:51.712051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15797","last_updated":"2024-12-20T11:14:29Z","snapshot_observed_at":"2026-07-06T20:10:51.514813Z","submitted_at":"2024-12-20T11:14:29Z","title":"Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15797","snapshot_observed_at":"2026-08-07T15:38:48.422552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.422552Z"},"links":{"cited_paper":"/paper/2412.15797","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:425f163201a74e362511206737ce94bddd617ef961f12d27d1c4c755800cb10f","observation_id":"326fe5bc-3c46-494f-8c9c-400f7d0fc181","resolution":{"observed_at":"2026-08-07T15:38:48.422552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T15:38:48.565575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.565575Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:2544132eb8aee52cdd83546c8baf9f90f96620f875f27f2f3bfd7dc4399a1bc6","observation_id":"e003c48c-8e24-486b-a8ce-5a086ee337bd","resolution":{"observed_at":"2026-08-07T15:38:48.565575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T15:38:48.738925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.738925Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:de4a9cd8133a3e7b86a0dd9b3a0f0537a24883070af23e8c72eb368ed8aee9ca","observation_id":"3a7b88cd-be1a-4b3a-bf1a-3897f50274cc","resolution":{"observed_at":"2026-08-07T15:38:48.738925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:38:48.946473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.946473Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:a4365cee64b6579d4a78bd5bd933110755ac568ea7a7e2db53e8f2f244467ce2","observation_id":"fc93cedd-75b4-4182-8da9-3dd5f9219ee9","resolution":{"observed_at":"2026-08-07T15:38:48.946473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.334672Z","title":null,"venue":null,"work_id":"59ec2628-e4f2-4448-8bb4-a45a9b613e1c","year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.158853Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:9208c8afd0e2d1f1249bd958b385ab6fea50fb98c1779b0304b761ffbc50fbb0","observation_id":"ca3e96b9-940b-4df8-8af2-26d93ae340af","resolution":{"observed_at":"2026-08-07T15:38:51.448514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.104796Z","title":null,"venue":null,"work_id":"e37c1adc-8345-43ec-bc22-de1edc23404e","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.306606Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:5bd0c920f0df03a5c43c949128cd91b6204ff45aef856670a533c46383300776","observation_id":"a30162a0-c2bd-4ab1-9c0c-bbce5076f09d","resolution":{"observed_at":"2026-08-07T15:38:51.195028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.425108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.425108Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:c50af82e7eb05e7d278b8137373fe57a46adfc1ff5d0c30e44ebc926ebdca592","observation_id":"5eab2423-d5b3-4a0d-be5b-c291cdbcc078","resolution":{"observed_at":"2026-08-07T15:38:49.425108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:38:49.624831Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.624831Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:88de235d46713c86327a5528ff70f2d0a9f04bbd8bbe3ffd2effc613ff70433a","observation_id":"abf49cd1-0d55-431d-8f3f-9634012cd3ee","resolution":{"observed_at":"2026-08-07T15:38:49.624831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T15:38:49.778223Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.778223Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:5b12eabdeb005c0aa55f70c45414ea721150cc49caf2a169ea136f3c2b43020d","observation_id":"fbafd562-03d0-411e-8ae2-bf6c467f52eb","resolution":{"observed_at":"2026-08-07T15:38:49.778223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.874379Z","title":null,"venue":null,"work_id":"c1c6623b-5821-45ee-9ea5-2fd03bd861af","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.897802Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:74f593ebf98a8371305c5e78912a1cd0ba7a6acaa05e24abe1a9fa3ac49fc539","observation_id":"64034c53-e4af-46bc-87c3-a756aa20b3df","resolution":{"observed_at":"2026-08-07T15:38:50.970290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02658","last_updated":"2024-10-14T19:33:00Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T00:57:51Z","title":"Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02658","snapshot_observed_at":"2026-08-07T15:38:49.957959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.957959Z"},"links":{"cited_paper":"/paper/2402.02658","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:44e133ecd8f52395bbf0a782c0e13b405b35457b38af32adfbd12ecfe532aec8","observation_id":"c9c70a28-981a-443c-b618-94a132a8e05b","resolution":{"observed_at":"2026-08-07T15:38:49.957959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.036904Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.036904Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:d657786f636cf45aa0d90cd47064f63a342c5e0a638226672daaca975d93a6d7","observation_id":"4d06186d-a39e-4144-ba60-7034a482949e","resolution":{"observed_at":"2026-08-07T15:38:50.036904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T15:38:50.099971Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.099971Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:72b918157601099856d0f89af90608c5a0ced8a7565b967a001028cdc8759f62","observation_id":"5ab26c4c-3faf-40a7-a2b6-f62068ae0116","resolution":{"observed_at":"2026-08-07T15:38:50.099971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T15:38:50.179847Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.179847Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:b37cce40fb6503a9cc5bccc4a3a980f8484c56a2974b7e614e03d68a8237abdf","observation_id":"53065805-6222-4cb9-827c-c369526c799f","resolution":{"observed_at":"2026-08-07T15:38:50.179847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T15:38:50.251756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.251756Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:c957713ef14789a2ee4d339e7f969a2633e0f95a47d370ae5a7594f01a731ecc","observation_id":"630a15a5-4fd0-4948-9489-2af1c8d60d94","resolution":{"observed_at":"2026-08-07T15:38:50.251756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-05T20:30:49.812919Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-07T15:38:50.332584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.332584Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:5afd676f5e1b805edac1dae3125a770b15956a790290f9217083345dd4658337","observation_id":"32fdfd0e-e858-4043-823d-a09a5e0bef91","resolution":{"observed_at":"2026-08-07T15:38:50.332584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 5 inbound Pith citation observations for arXiv:2505.14391."}