{"as_of":"2026-08-07T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6d810e4b136f0afeccdda6700e38082217d9d91c3164993a2a4962b02d698d8","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:21.519840Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:58:49.973078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:53:06.955702Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19706","snapshot_observed_at":"2026-08-05T22:58:49.973078Z","title":"arXiv:2505.19706","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06124","last_updated":"2025-08-08T08:43:24Z","snapshot_observed_at":"2026-08-05T22:58:48.813792Z","submitted_at":"2025-08-08T08:43:24Z","title":"AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:49.973078Z"},"links":{"cited_paper":"/paper/2505.19706","citing_paper":"/paper/2508.06124"},"observation_digest":"sha256:2b82cc4ade27ba08f0ad5e3d8053926bcaca5a127598f08e539c6b83dfe97452","observation_id":"a1b42452-0fdc-42ee-af57-006b3dd497e1","resolution":{"observed_at":"2026-08-05T22:58:49.973078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"cited_work":{"arxiv_id":"2505.19706","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19706","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error typing for smarter rewards: Improving process reward models with error-aware hierarchical supervision","venue":null,"work_id":"5d3a1715-36ab-44d6-952f-2511df74f984","year":2025},"citing_paper":{"arxiv_id":"2605.15529","last_updated":"2026-05-15T01:57:11Z","snapshot_observed_at":"2026-08-04T04:14:15.447935Z","submitted_at":"2026-05-15T01:57:11Z","title":"Process Rewards with Learned Reliability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T14:51:13.966538Z"},"links":{"cited_paper":"/paper/2505.19706","citing_paper":"/paper/2605.15529"},"observation_digest":"sha256:5ddeca199f03867aa087461c150ab32bdf739079029212659300bf8dbd60e2fb","observation_id":"bc392757-c65a-47c2-ae0a-5adced636e00","resolution":{"observed_at":"2026-05-19T14:53:06.957200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19706/citation-record","integrity":"/paper/2505.19706/integrity","json":"/paper/2505.19706/citation-record.json","paper":"/paper/2505.19706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:18.968255Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:18.968255Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:508504a5ba5f1eabc7e0af9bc6ce8cda0a5db8c5ae658a990ee9dcae42ba8c0f","observation_id":"b5c6f086-183d-422b-a08b-8f31bb64ebc8","resolution":{"observed_at":"2026-08-07T14:14:18.968255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:14:19.156320Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.156320Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:550677d7ae8dc9e3f2971b8101d2e3f034fa742f2e1a2e7b19ab6276cc440ace","observation_id":"6d751b58-6292-4e64-b21a-6bb4a7c6ffe9","resolution":{"observed_at":"2026-08-07T14:14:19.156320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:19.237664Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.237664Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:7d65ade2e63d696ebebaaa36fa7c0d5bff8ba42e1bee1ac2b07bcf2faef2ed34","observation_id":"5011179a-17b5-44e5-85fa-4f9aeb89f488","resolution":{"observed_at":"2026-08-07T14:14:19.237664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:14:19.319766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.319766Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:075fb406cecc58d833ffd4f493bf27ac9d5b158b49a2656d17bdf1bb6d71c977","observation_id":"2adfa8dd-79b8-4883-979a-77031df66ba4","resolution":{"observed_at":"2026-08-07T14:14:19.319766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-05T04:32:32.994993Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:14:19.428465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.428465Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:d5594764a4a2a059c217773251fb160c5c53b8ec95b838a4a411d3b96ac4b68a","observation_id":"c9834023-d4e3-4163-b2fb-b9b35d000c63","resolution":{"observed_at":"2026-08-07T14:14:19.428465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T14:14:19.554437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.554437Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:bbfa299e455f968ba614b092e7e28d2477b0243971fa0e1d5514e6f775adf84d","observation_id":"efd378be-ec6a-4293-9a0f-93cb4fb7e8f6","resolution":{"observed_at":"2026-08-07T14:14:19.554437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.935050Z","title":null,"venue":null,"work_id":"7acc6ee9-89f5-4413-b4b8-987b8efe2b43","year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.674351Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:303f34c763078758c2f42df93563b5a14f8f92b354a9dbe985465650f454f669","observation_id":"8513cbaa-decc-4914-953b-2c653543a98a","resolution":{"observed_at":"2026-08-07T14:14:22.011172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.768755Z","title":null,"venue":null,"work_id":"d9ee9623-6fd0-4a87-8d89-e36e667124b0","year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.783614Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:2ca2d8a6a1743484d77830d858cfccf26f221754ca1e3bf5a7af8d01ab5e2439","observation_id":"b66f5c06-a081-477e-87d8-c6ef3911f85e","resolution":{"observed_at":"2026-08-07T14:14:21.835635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-05T02:17:27.976287Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-07T14:14:19.876368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.876368Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:cc6380983f16817e0a4be2ba3509848e0f09764a7a11c22b79eba5b821d78cbc","observation_id":"a86bc2bd-c4a8-4c07-8e90-39319c29e13c","resolution":{"observed_at":"2026-08-07T14:14:19.876368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-07T08:05:38.374743Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-07T14:14:19.989779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.989779Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:1e0d67fa7be57d67c657f6a583eef59e90b3790709adc1dbed78c4d4e478502a","observation_id":"58760b42-ef1c-4624-b54b-aa01c9a01cad","resolution":{"observed_at":"2026-08-07T14:14:19.989779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09472","last_updated":"2024-12-10T08:54:09Z","snapshot_observed_at":"2026-07-06T17:44:37.894023Z","submitted_at":"2024-03-14T15:12:38Z","title":"Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09472","snapshot_observed_at":"2026-08-07T14:14:20.136880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.136880Z"},"links":{"cited_paper":"/paper/2403.09472","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:12e8340eacae8bc3931bb8c0ee6e596b24cfad4216357df3db16c99680854aa9","observation_id":"56a5b2ec-712a-4545-8dd9-8ba54ba819fc","resolution":{"observed_at":"2026-08-07T14:14:20.136880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11520","last_updated":"2025-02-17T07:41:27Z","snapshot_observed_at":"2026-07-06T20:37:37.864423Z","submitted_at":"2025-02-17T07:41:27Z","title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11520","snapshot_observed_at":"2026-08-07T14:14:20.254758Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.254758Z"},"links":{"cited_paper":"/paper/2502.11520","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:c4b4cf7c35141e355efd393b79f1745ba7ad75bd252381cc3d305090887f6ea2","observation_id":"88c8303b-0f73-4d43-88c7-98bc4cfb0d3d","resolution":{"observed_at":"2026-08-07T14:14:20.254758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T14:14:20.364504Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.364504Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:b7ae86c6592b0ddf4d8c35603281e2743024ea85eef27f4e06ad0e26fb8c3667","observation_id":"b52878ae-1e85-4ec6-9057-86ea82c1a8c9","resolution":{"observed_at":"2026-08-07T14:14:20.364504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-04T14:33:36.204296Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-07T14:14:20.522619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.522619Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:2ca7d26dd1b696c3a726c98122aee95aa58fd4bddcacf21dae018180266d68e7","observation_id":"879e5c96-25ab-4a97-b84f-7b061a93b65f","resolution":{"observed_at":"2026-08-07T14:14:20.522619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.610933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.610933Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:b18a9dc8d1bd20194f5ff632892f7bfbdb51df5882bcae9fa401a133b53afbd1","observation_id":"89155cee-1c19-481b-823d-169683158bd1","resolution":{"observed_at":"2026-08-07T14:14:20.610933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T14:14:20.694287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.694287Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:467560c86780a9368e1ed9030317a03d152046415f946d195b0b0a314a806fa8","observation_id":"55b9c388-e4ae-40c2-8c1a-b682b88306f3","resolution":{"observed_at":"2026-08-07T14:14:20.694287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.773480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.773480Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:ffb46b42c90cfd39cf3e6655807d4c5d6392525a5a72f904fa93a2597cb2a4d5","observation_id":"c640f3d6-9084-40a9-a532-b9e2b78e8fd3","resolution":{"observed_at":"2026-08-07T14:14:20.773480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.861017Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.861017Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:864386924c7f9b73ea77ad500f0439fbbcc77c5cbe6b4e9687591f44a1762acf","observation_id":"cd0f8c5f-24aa-41c6-a3e4-cdccf5033517","resolution":{"observed_at":"2026-08-07T14:14:20.861017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.931464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.931464Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:7628f3c2307f7922d4495b384c2610b0bfb4695bf084c3da7ff937510e114fc1","observation_id":"ba321121-99fe-4196-8d6d-d1a4d1c5fce0","resolution":{"observed_at":"2026-08-07T14:14:20.931464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.023530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.023530Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:e15da558b41400c4b43d50f25cddd81dae22a9b949aeb86c5e2c587263758f4a","observation_id":"828d72b4-303a-42e1-bcc8-3f04d1b990c8","resolution":{"observed_at":"2026-08-07T14:14:21.023530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:14:21.092331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.092331Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:91024c5d65ae5dd1f656f3c86824d07d72ca7ad4f4a12bb61dc2772863280189","observation_id":"9120d802-a4f3-4240-ba10-d949d515721a","resolution":{"observed_at":"2026-08-07T14:14:21.092331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T14:14:21.168455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.168455Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:b32b2fa000a5aba85185a0445c85708859519eaa72a4343927ea1d0892f352fa","observation_id":"85eae2ab-d0f4-483b-9e3f-d46c1d24eeb0","resolution":{"observed_at":"2026-08-07T14:14:21.168455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00891","last_updated":"2025-04-05T03:04:37Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:21:05Z","title":"GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00891","snapshot_observed_at":"2026-08-07T14:14:21.245461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.245461Z"},"links":{"cited_paper":"/paper/2504.00891","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:b411c41d2d544d2b33ca87fdeaa1d0b69bc5314af649a80170f11ec1c42c11c2","observation_id":"0606978e-3802-4f8d-be98-70a2a53d2731","resolution":{"observed_at":"2026-08-07T14:14:21.245461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-05T20:30:49.812919Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-07T14:14:21.314240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.314240Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:ee5ad15c0469a4dd7550b1a65ae5c1791572bc2ed599aaedf56807f2daa04b35","observation_id":"54282e4b-965d-4c47-8922-efafabd17d13","resolution":{"observed_at":"2026-08-07T14:14:21.314240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.388599Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.388599Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:7c717af5cfaa0cb41a9592b9fd6ebca6943bcae3ddf5bbb70c700359eeb56c77","observation_id":"c8b28158-9ba8-4576-bf51-3fbe86659bd2","resolution":{"observed_at":"2026-08-07T14:14:21.388599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.519840Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.519840Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:d18693e995dd73fc3fa40836400252944c68404bf90f38b90129f0fbc1b12016","observation_id":"c2acf720-a52c-4464-9441-157725fd18b0","resolution":{"observed_at":"2026-08-07T14:14:21.519840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2505.19706."}