{"as_of":"2026-08-05T12:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6519acb24e7c9ce55677124b4a718c5b10c4a40040b486c18208e04208f5ccef","coverage":[{"denominator":237,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:50:14.455925Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:33:55.284758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:34:21.193405Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"cited_work":{"arxiv_id":"2510.01925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.01925","snapshot_observed_at":"2026-08-04T02:39:30.770950Z","title":"Enhancing large language model reasoning with reward models: An analytical survey","venue":null,"work_id":"8c8d8d11-c25e-43b3-aa44-20b8338f989e","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2510.01925","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:aacae6a783cd8778638ef802b05906edae35c6938070e09536537fd691011425","observation_id":"f7a80c14-a5b8-4864-83fe-7e0763e01262","resolution":{"observed_at":"2026-08-04T02:39:30.770950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"cited_work":{"arxiv_id":"2510.01925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.01925","snapshot_observed_at":"2026-08-04T02:39:30.770950Z","title":"Enhancing large language model reasoning with reward models: An analytical survey","venue":null,"work_id":"8c8d8d11-c25e-43b3-aa44-20b8338f989e","year":2025},"citing_paper":{"arxiv_id":"2606.29296","last_updated":"2026-06-28T09:36:43Z","snapshot_observed_at":"2026-07-07T00:03:16.968118Z","submitted_at":"2026-06-28T09:36:43Z","title":"Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T07:33:55.284758Z"},"links":{"cited_paper":"/paper/2510.01925","citing_paper":"/paper/2606.29296"},"observation_digest":"sha256:2f5ceb68e914054af96d83d8e3c1e0f53fa3ca72d8500d2f54809ef776068572","observation_id":"164d8e26-45ef-4cf3-8df2-4949f61a554c","resolution":{"observed_at":"2026-08-04T02:39:30.770950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.01925/citation-record","integrity":"/paper/2510.01925/integrity","json":"/paper/2510.01925/citation-record.json","paper":"/paper/2510.01925"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.446684Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.446684Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e1f2961cced579963ee82f646a92d60db7413b7ef0767897665875b828c55bdf","observation_id":"6a95a03b-b4f4-49b2-b6ff-8f78f760ae73","resolution":{"observed_at":"2026-08-04T12:50:11.446684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.538204Z","title":"A survey on medical large language models: Technology, application, trustworthiness, and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.538204Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:f2e0fdf79638608dd279a16e4162d0875cd2bb46f58ca2bc374a76e04cfd3083","observation_id":"b6e20d2d-894b-47ca-ae63-178c0d13bf54","resolution":{"observed_at":"2026-08-04T12:50:11.538204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.629883Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.629883Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:677c0e0a883e5dc212c311cb80fdfab603c8688510e9a7b7093418c9309e1cb6","observation_id":"65b334fc-5c3c-40d4-838f-f19870cc37c1","resolution":{"observed_at":"2026-08-04T12:50:11.629883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.737873Z","title":"Bridging the linguistic divide: A survey on leveraging large language models for machine translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.737873Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:0760f43b4227a09d712d016da91af23cba01e1752d363164f2de4ea6bebcaf06","observation_id":"c370ca9e-e056-49fa-8d3e-cb3afc8a303f","resolution":{"observed_at":"2026-08-04T12:50:11.737873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.882413Z","title":"A survey of large language model agents for question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.882413Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:78ea33d2250a93249acf37d17b0cd340a627ab9bf5ba29a327cc323262a5ba80","observation_id":"1d8737de-91ae-41cd-92b0-e8f84df5295c","resolution":{"observed_at":"2026-08-04T12:50:11.882413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:11.992118Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:11.992118Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:02755f4b44176b1fe734d5e6ec69d240333c4352d8e9b285fba7616c71ebe05f","observation_id":"ae81b415-d7fe-4ba0-985b-9ba7ec0433a0","resolution":{"observed_at":"2026-08-04T12:50:11.992118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.143679Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.143679Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:9157dee1181c0095503bffc7fb08306dfb601f7c8f5e10972c1f2be9c08fd9ab","observation_id":"18adfcb1-2319-44cd-9f3d-1d7c1e4aa7ff","resolution":{"observed_at":"2026-08-04T12:50:12.143679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.214479Z","title":"Solving quantitative reasoning problems with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.214479Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:947ed23d9de7ae84dbc20a2a0525458716cfb36471e819f1010bba2e67814b46","observation_id":"c9f8af63-0dc6-4316-b611-4a2427c02a59","resolution":{"observed_at":"2026-08-04T12:50:12.214479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.420548Z","title":"Mint: Boosting generalization in mathematical reasoning via multi-view fine- tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.420548Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:8fbea6fc37313a572f3f26219c57b71167ffa619178ed4a5cbdbc9d3066ead71","observation_id":"f644d140-efad-432d-a2ca-8e7decfdc0ae","resolution":{"observed_at":"2026-08-04T12:50:12.420548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.587474Z","title":"Robust visual question answering: Datasets, methods, and future challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.587474Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:66a45d2a203353a6b48ceaf0b85e6ca128a460a13d54c1a35365bc955a5a5d8e","observation_id":"4c3fccd9-6d9c-47b9-813a-21767d5ae8a1","resolution":{"observed_at":"2026-08-04T12:50:12.587474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.732400Z","title":"Learning from mistakes makes llm better reasoner,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.732400Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:b6bfd7606c54f9047bbb614e66031fcb9fffc0d0702a8112b9894e37d10811d2","observation_id":"f8981c89-8024-4280-9ae5-cc7fbbd06622","resolution":{"observed_at":"2026-08-04T12:50:12.732400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.808295Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.808295Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:517ddb8c779438944bf7e00db88f17f527f71313dcee8254198a162d1ab0689b","observation_id":"3a065f67-c3ad-430a-b49e-c3d5149b28ec","resolution":{"observed_at":"2026-08-04T12:50:12.808295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:12.975965Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:12.975965Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e51a694158efb21dfb81d1171ae775f52bb0ad0b2d3ef28e129df26e4ae6453b","observation_id":"950a09d0-1904-48a1-9562-6f0e773b16ae","resolution":{"observed_at":"2026-08-04T12:50:12.975965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.143684Z","title":"Tulu 3: Pushing frontiers in open language model post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.143684Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:046d5081cdcced59709336cc5ed51f6e75358dd7a82f15bb58e8d4230ce7209c","observation_id":"e4325a14-3785-49b1-93f3-cf31d7f3b076","resolution":{"observed_at":"2026-08-04T12:50:13.143684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.248734Z","title":"Rlaif vs. rlhf: Scaling reinforcement learning from human feedback with ai feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.248734Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e636ef24039fefac1be630b83d35cc3ec0ac70367a7baad1f602166df932e6f5","observation_id":"981c5ca8-a72c-4135-ad62-cfd7f79f12f8","resolution":{"observed_at":"2026-08-04T12:50:13.248734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.351189Z","title":"Improve mathematical reasoning in language models by automated process supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.351189Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:ff4af9cebe8ce86252c25003fd00eba152c2e0ef43317c1018451501bc2a7f58","observation_id":"4c08e556-8a2e-4a4a-940c-32915323eb0a","resolution":{"observed_at":"2026-08-04T12:50:13.351189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.423567Z","title":"Advancing process verification for large language models via tree-based preference learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.423567Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:05f967b8dafd1df49b652ce3c1b3cd5707d78a860835ba18729596eded882ede","observation_id":"6af97ff9-afa4-4bb8-9479-d4dc555b1d68","resolution":{"observed_at":"2026-08-04T12:50:13.423567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.579366Z","title":"Token-supervised value models for enhancing mathematical problem- solving capabilities of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.579366Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:f66eda5edbbb985f8d7100c0027a5a33e5affc983e5d5954c3c856b52d2db780","observation_id":"c7e351f8-e6d2-48c5-9501-a5d1086c29ab","resolution":{"observed_at":"2026-08-04T12:50:13.579366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.720766Z","title":"Coarse-to-fine process reward modeling for mathematical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.720766Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:cee37971edc211da776535d116ebfe10333e547d2bf2155018641e56bbc4051b","observation_id":"c4b5c155-a019-4f16-a769-d041a4e76f53","resolution":{"observed_at":"2026-08-04T12:50:13.720766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.786433Z","title":"Visualprm: An effective process reward model for multimodal reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.786433Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:08053dee31de1e86fdd1910da3838c12f68c1ffd2c6d5d42958fc6bf6520ed24","observation_id":"eca445c4-b06e-4aa0-b5bc-31c18bc3b413","resolution":{"observed_at":"2026-08-04T12:50:13.786433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.846001Z","title":"Towards hierarchical multi-step reward models for enhanced reasoning in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.846001Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:ccc73caa09dc334d21dd7bcb7d1d1d7011b02426e6820e0729cb033571629cc2","observation_id":"5443f8b8-3ebd-443c-9a89-70cf63c28350","resolution":{"observed_at":"2026-08-04T12:50:13.846001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.909596Z","title":"Adaptivestep: Automatically dividing reasoning step through model confidence,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.909596Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:339bf18f0f65dfa5982da22b36c24b84220f4ea9ca30a995476c9bd7a09f74d6","observation_id":"d2640117-11e2-4710-adc8-743fb1fe0347","resolution":{"observed_at":"2026-08-04T12:50:13.909596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:13.958049Z","title":"Vilbench: A suite for vision-language process reward modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:13.958049Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:3edfb08107c96a9bc82ca2cdbf46bd762e99d2bd50d3bda2cb7952fc713c47b3","observation_id":"28d0a2a0-ff23-4c26-89cd-1a4483651a9a","resolution":{"observed_at":"2026-08-04T12:50:13.958049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.001961Z","title":"Retrieval-augmented process reward model for generalizable mathematical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.001961Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:41076dc94d3cceee8e1386cbb4217cee3453e7cca345f71614701dc3ba60a75e","observation_id":"ba058eca-24e4-461c-b5fb-cf29e90f5df4","resolution":{"observed_at":"2026-08-04T12:50:14.001961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.007078Z","title":"Making large language models better reasoners with step-aware verifier,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.007078Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:469de94d1d455c434874c298f0aa3041da9d024db10b92598387e60f72db90c5","observation_id":"8ccec1ab-d979-453c-a289-11b26413f3ca","resolution":{"observed_at":"2026-08-04T12:50:14.007078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.011843Z","title":"OVM, outcome-supervised value models for planning in mathematical reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.011843Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:9aac69c48eaaf43af58c096afc4b038eb81478edee0cf035c164a2abb39284b7","observation_id":"6a8f422e-487f-46a6-9b20-be7b6bc2fd49","resolution":{"observed_at":"2026-08-04T12:50:14.011843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.016975Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.016975Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:1901868bfcf579ad64ee28b548387aca4ddea27eb635117bd69a87980a689b92","observation_id":"7b64f80e-d236-46b9-b8cc-72d92c42beea","resolution":{"observed_at":"2026-08-04T12:50:14.016975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.022888Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.022888Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:9677e2c33a661115f08111c649a1de101a16bd54e254594bc2ab7f8080c8dcc7","observation_id":"433a7e1e-6775-4291-9644-ea8689f8ee86","resolution":{"observed_at":"2026-08-04T12:50:14.022888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.027754Z","title":"Multi-step problem solving through a verifier: An empirical analysis on model- induced process supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.027754Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:68b5fbb50ee07f56298ea0618f0a1a3c7f1cd3b5afb7b73beb6b93d9f6849dd7","observation_id":"7a3c37f8-591c-4326-a71f-cb7f409997ba","resolution":{"observed_at":"2026-08-04T12:50:14.027754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.033978Z","title":"Glore: When, where, and how to improve llm reasoning via global and local refinements,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.033978Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:b160b9829e75a045b83e8fd029f54ba7bfbbf4ca7580a3d3d0b19c899469027d","observation_id":"2f72ca02-c683-4cf8-98bd-f5772585239a","resolution":{"observed_at":"2026-08-04T12:50:14.033978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.040227Z","title":"Autopsv: Automated process-supervised verifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.040227Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:77412eb51c88a861284d0048af98c5d5c3d2f1ba944defd54d9bade8e8c930a7","observation_id":"88c18d37-aa41-4b9e-bb90-69f189371aeb","resolution":{"observed_at":"2026-08-04T12:50:14.040227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.045182Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.045182Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:98c532696fdccf9cd37031bd0d40f66ec8254ea00d8079bb8d77540bf73ff76c","observation_id":"8968b538-1925-4c66-aa34-f30e9132d774","resolution":{"observed_at":"2026-08-04T12:50:14.045182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.049808Z","title":"Entropy-regularized process reward model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.049808Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7bd9d5cb9cbd6ff31307efe5a21a5357659011100e30fbce2f2e5b16e3eda32a","observation_id":"b7ab4a52-cfa4-4aa9-a172-a1ab6f8fd92a","resolution":{"observed_at":"2026-08-04T12:50:14.049808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.055627Z","title":"The lessons of developing process reward models in mathematical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.055627Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:f022a60a99f8dff4c51a308163bba996ce0051008f509c986aa28bf19b68cd40","observation_id":"c77ee0f3-2e86-47b5-8f74-a983dbd36d53","resolution":{"observed_at":"2026-08-04T12:50:14.055627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.060728Z","title":"Athena: Enhancing multimodal reasoning with data-efficient process reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.060728Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:2905c992bd2f7471065965c38fa0f22578482c6b3091fe08d52fec5015b4002f","observation_id":"ab145006-c49c-4cf3-b291-edabb76153e2","resolution":{"observed_at":"2026-08-04T12:50:14.060728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.065811Z","title":"Reasonflux- prm: Trajectory-aware prms for long chain-of-thought reasoning in llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.065811Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:ddc6a9e49f4c8a25f0da105dcfa9637d5c9df6d6ebbdb29299918d90b539f796","observation_id":"befc1ed4-b622-4123-bab2-c94636ece7cb","resolution":{"observed_at":"2026-08-04T12:50:14.065811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.070861Z","title":"Better process supervision with bi-directional rewarding signals,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.070861Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:1781d84a10abb87eab59e11bcfb35195d0090fdf4442cf4a5671d1ee266860bb","observation_id":"4408501a-b69e-4981-9330-cf4d776901e0","resolution":{"observed_at":"2026-08-04T12:50:14.070861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.076069Z","title":"Duashepherd: Integrating stepwise correctness and potential rewards for mathematical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.076069Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:222ac010979077d9d06c10415e1dfb38967c7fe1f85b5d8127eaa3768ecc9850","observation_id":"8dddc48c-0f60-4287-9611-42325f6876af","resolution":{"observed_at":"2026-08-04T12:50:14.076069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.081769Z","title":"Llm critics help catch bugs in mathematics: Towards a better mathematical verifier with natural language feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.081769Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e25b02c25ecab6b66e8c6e17757e6af9b4639a106c7517398af4b96a27675768","observation_id":"f3afe761-2cb0-4162-91ac-f4de9e071fab","resolution":{"observed_at":"2026-08-04T12:50:14.081769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.087042Z","title":"Verifierq: Enhancing llm test time compute with q-learning-based verifiers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.087042Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:c6cb5229123d7ee59a93df9c1c26dc114a1ee74713e7791efccf3d6fb17c198b","observation_id":"ccae60fd-d920-45d0-9365-716493bd0814","resolution":{"observed_at":"2026-08-04T12:50:14.087042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.091680Z","title":"Process reward model with q-value rankings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.091680Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:91ccd84e324b0ccdbd810b19326cd755a2c4d642041eab222a3607673c6517e3","observation_id":"27ef61a6-9cc6-40ba-b6a0-f5ccb540c2ca","resolution":{"observed_at":"2026-08-04T12:50:14.091680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.097267Z","title":"Free process rewards without process labels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.097267Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:cc5e1d73f24d1d8a5f3c15b4a6a795e2a8ed71e61ba9149c8aa87a3f0597dd15","observation_id":"f7882463-865e-40ff-ac78-288d7aadc790","resolution":{"observed_at":"2026-08-04T12:50:14.097267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.102294Z","title":"Tdrm: Smooth reward models with temporal difference for llm rl and inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.102294Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:887badca5477206e2c23b648fef0fa03651779a4d256c9140fe45403435d2115","observation_id":"01adce31-8d2d-4fa5-884e-7fe0bc7392d0","resolution":{"observed_at":"2026-08-04T12:50:14.102294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.107620Z","title":"Cold: Counterfactually-guided length debiasing for process reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.107620Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:f9d4dc8a8afa109ef421df0a32c0234e5e76c04c94a3f38fb96fda723201a284","observation_id":"a200b818-8382-436a-a452-8143c0dff7a4","resolution":{"observed_at":"2026-08-04T12:50:14.107620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.112528Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.112528Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:87ab0e12b8a2c8d286938110564583dc13b269fba194b0e17f47ffc5e4ef0508","observation_id":"e89cb355-f8ea-4ae0-b6a0-ef27e848e98c","resolution":{"observed_at":"2026-08-04T12:50:14.112528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.117447Z","title":"R-prm: Reasoning-driven process reward modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.117447Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:52a713bb6ae981ccaddbc3cdf7bd5eab555a2fde13979543e976f83b17710f81","observation_id":"9d2ee219-2bc4-4091-829f-2b661ddf8888","resolution":{"observed_at":"2026-08-04T12:50:14.117447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.122164Z","title":"Genprm: Scaling test-time compute of process reward models via generative reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.122164Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:ab7a16426a420ce4dd0e297bbd355fba300f179e993803e478a38765108d8b95","observation_id":"be1a5fa3-5341-4c3e-9234-ef468524ca33","resolution":{"observed_at":"2026-08-04T12:50:14.122164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.126809Z","title":"Scaling evaluation-time compute with reasoning models as process evaluators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.126809Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:b7799e501c31c00ef6266c96be6b0f879fe42718c0afdd9acdf93de3531df650","observation_id":"4d51a8c8-48d9-4934-809c-7119f83912af","resolution":{"observed_at":"2026-08-04T12:50:14.126809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.131449Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.131449Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:4f76c9bf0891772718c7278c3c260fec2aefadd35361b695b1353234829d8294","observation_id":"76d66861-1957-4ba2-b2fe-dedda3c8cbd9","resolution":{"observed_at":"2026-08-04T12:50:14.131449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.136042Z","title":"Process reward models that think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.136042Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:c8eae851281212b301dffbecc2f50db4a3f4a7808f963c086a5a79786ac9cd17","observation_id":"bbe06494-acc8-4c38-a858-43c3b4aad374","resolution":{"observed_at":"2026-08-04T12:50:14.136042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.140823Z","title":"Stepwiser: Stepwise generative judges for wiser reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.140823Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:9ffadfddc3fd938b95d528562a7c6b0bab6b6394f73bf169aa6eefdef59a2ffc","observation_id":"61214e6f-b510-4091-b14d-ee68f711d656","resolution":{"observed_at":"2026-08-04T12:50:14.140823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.145897Z","title":"Solving math word problems with process- and outcome-based feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.145897Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:99ae66da385547daf041f454c93712e24de18bada470a9785e0080e914e292c0","observation_id":"b06b301d-a20d-49f7-9737-a6f4102106fc","resolution":{"observed_at":"2026-08-04T12:50:14.145897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.151147Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.151147Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:c018879c272323589d9b43b95eea0a895ffc59cc597c59685a9d3662c3051211","observation_id":"1cbbbe4a-bad6-4e2f-8364-245db7f3694c","resolution":{"observed_at":"2026-08-04T12:50:14.151147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.156123Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.156123Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:8aaa43bfc4f2e971d12848e48e8198138b6876ba1236232aab8c4d153b43d4d2","observation_id":"76ad99b6-4c7c-45fa-8c2e-99022405ebaf","resolution":{"observed_at":"2026-08-04T12:50:14.156123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.161725Z","title":"Inference-time scaling for generalist reward modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.161725Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:1e56d0cfea23fd2adef427349b946ee32777a3694d7823bd23eec9a75f1f5dc8","observation_id":"24752388-79e7-4524-a446-463b178d4f31","resolution":{"observed_at":"2026-08-04T12:50:14.161725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.166927Z","title":"Rm-r1: Reward modeling as reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.166927Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:d1f905317b6170173f232aa5ad14487707badf54aa3480b0202655af31e691bc","observation_id":"0c6389cd-8e02-4b3d-9cbf-f15607c33540","resolution":{"observed_at":"2026-08-04T12:50:14.166927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.172485Z","title":"Ticking all the boxes: Generated checklists improve llm evaluation and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.172485Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:c4b9e89d87a01ce202746678c77cb781afe778c0f71fc67e5c4733b032f5ce1c","observation_id":"cdee736f-d475-4b72-899c-0a4c02b6b925","resolution":{"observed_at":"2026-08-04T12:50:14.172485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.179185Z","title":"Generative verifiers: Reward modeling as next-token prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.179185Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:8ffb4030db1bd57f46b20037a790d318f3267e32da18235be35d259cf3a8c568","observation_id":"e4998b6c-4cd6-40d7-a80c-5d98d63c8ce0","resolution":{"observed_at":"2026-08-04T12:50:14.179185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.191895Z","title":"Critique- out-loud reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.191895Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e5602765c582d2a3c1dcd3a03db6cb2579c32bd14fbb15f8cf84ce4a1fa591e6","observation_id":"2ebd94fd-e49a-4f0e-95f8-147d6e6895dc","resolution":{"observed_at":"2026-08-04T12:50:14.191895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.198834Z","title":"Learning to reason for factuality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.198834Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:d8e592d0f74ca430dff95190083cb5be24a6983ee52b7d06b964612cd864d873","observation_id":"20c3961f-533c-47ad-86e2-49c113d7c270","resolution":{"observed_at":"2026-08-04T12:50:14.198834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.204462Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.204462Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:833c8626bc8d45d8cd691e9be38afaf4d0f6f439ccbfb468f9c20a9f9a6cf823","observation_id":"fd9daef2-a439-4c94-b2ae-f505cb3dd325","resolution":{"observed_at":"2026-08-04T12:50:14.204462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.210688Z","title":"Advancing llm reasoning generalists with preference trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.210688Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:967c0cd482a54e72ecc72d72031f6d6367b8c00af2c6b5b3c51f2c20c5bc34aa","observation_id":"61b89141-ee5b-4567-99f3-70931fcdeeca","resolution":{"observed_at":"2026-08-04T12:50:14.210688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.217014Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.217014Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:1a237d52630a61b11702ea0e66690a5e14a4303cd69bf1a5d9002733b092494f","observation_id":"d1c2da0e-e220-400c-be60-df02b0bac22f","resolution":{"observed_at":"2026-08-04T12:50:14.217014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.222461Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.222461Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:26782e1f40ae3da84c6be31befea6d38b6f3470eea92f7427cbecced8c336283","observation_id":"5bb0ab0c-1d27-43c0-8f6b-8918b146373f","resolution":{"observed_at":"2026-08-04T12:50:14.222461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.227834Z","title":"Helpsteer2-preference: Complementing ratings with preferences,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.227834Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:dd47eebf7d4f56d60846fec2d93789325b1c4623acf011551215f636827b2d09","observation_id":"56d9afaa-df45-409e-a399-24120d42a894","resolution":{"observed_at":"2026-08-04T12:50:14.227834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.234159Z","title":"Kto: Model alignment as prospect theoretic optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.234159Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:58324ce455eb1878f3cd225612a0da5028192a0dfe0be4d5593f9848eff6890b","observation_id":"329c4246-a507-4fd1-bd8b-e85ec45be23b","resolution":{"observed_at":"2026-08-04T12:50:14.234159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.240277Z","title":"Bootstrapping language models with dpo implicit rewards,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.240277Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:80e47d797237048d31ffa7d8fc25cf06fa7f4c2288d3550c1298c5c96bf99dc5","observation_id":"5ef321d4-55b3-4ec8-b7ad-18158bb74f12","resolution":{"observed_at":"2026-08-04T12:50:14.240277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.248424Z","title":"Generative judge for evaluating alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.248424Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:aa1426e28e856750a87d42dc16b83cadec713f6451d937dd58ae7152e801611f","observation_id":"18a0ae5c-461a-4b89-83e2-6d6936083b15","resolution":{"observed_at":"2026-08-04T12:50:14.248424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.253828Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.253828Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:937b731358047e85a277dec404cced0747f72256871c012ff5a12a1d3bbdd465","observation_id":"f2687b2a-a7a6-4c83-bd06-33b5a89ad6a0","resolution":{"observed_at":"2026-08-04T12:50:14.253828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.261254Z","title":"Foundational autoraters: Taming large language models for better automatic evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.261254Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:747663174cc05935b81397521a3c14381338eabb73c4355ae40e48d33079f368","observation_id":"306e1539-27cc-4885-90f3-3278a3c43d64","resolution":{"observed_at":"2026-08-04T12:50:14.261254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.267067Z","title":"Compassjudger-1: All-in-one judge model helps model evaluation and evolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.267067Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:cf7d5faa442e2dd522886c0c31a66fdb5e13c262f2d39ecc6d96fd72fb9b21c9","observation_id":"20b41b39-442a-4110-99ec-3c25ceeed015","resolution":{"observed_at":"2026-08-04T12:50:14.267067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.271952Z","title":"Learning LLM-as-a-judge for preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.271952Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:a56c94f278540563420e35c68e0224aa347908182be208e58f205b9d78ac7237","observation_id":"8868fb80-26d3-4956-bc21-50e38fb58ec1","resolution":{"observed_at":"2026-08-04T12:50:14.271952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.277964Z","title":"Atla selene mini: A general purpose evaluation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.277964Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:e08b0f0e2edcf5fff66a5d845ca75c38cb06f21d00b67de5d010c94183715454","observation_id":"1a72b96d-905d-40dd-a5be-ff22e6f7351f","resolution":{"observed_at":"2026-08-04T12:50:14.277964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.284903Z","title":"One token to fool llm-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.284903Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:27e641416474464b72dcbf9b5c95f79a8d6c46a01ef5c084e6b1c525c204689b","observation_id":"7773e415-d4c1-4ebd-a5ac-f9ea264c205b","resolution":{"observed_at":"2026-08-04T12:50:14.284903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.290921Z","title":"Judgelrm: Large reasoning models as a judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.290921Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:6652a93ae6fe5bf3f8a692053490078392473382bc083d8fba835ced73ab5471","observation_id":"55d12648-5a30-45a0-84dd-349b799af72f","resolution":{"observed_at":"2026-08-04T12:50:14.290921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.296450Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine- tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.296450Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:de37f35a2f7c1855d1aaacde8a6ccb8fc63bd403bead8a247d6ca05cd104e093","observation_id":"0db24c57-7233-4313-a0a8-b13c38ba42b9","resolution":{"observed_at":"2026-08-04T12:50:14.296450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.309143Z","title":"Pairjudge rm: Perform best-of-n sampling with knockout tournament,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.309143Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7f266e6d62cb8414190a59d2e9c74613a815afd8467bda552bfd473a9e46a4ee","observation_id":"133d08d4-53ce-48e3-950a-6e7d79f1f8bd","resolution":{"observed_at":"2026-08-04T12:50:14.309143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.317780Z","title":"Rewardbench: Evaluating reward models for language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.317780Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7eee6221e69fa5fa88167d8c4bee61c8ce7e909d2f75348538011d3b943065ea","observation_id":"1e452d3f-45ed-45b5-8aa4-ac182bc87537","resolution":{"observed_at":"2026-08-04T12:50:14.317780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.324601Z","title":"Rm-bench: Benchmarking reward models of language models with subtlety and style,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.324601Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:0ff0124359894cd776639a085339bea02534aa28bbffc92677663a2e82a2a26d","observation_id":"43b14b7c-9b6d-4ef6-a48c-f750987d67b9","resolution":{"observed_at":"2026-08-04T12:50:14.324601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.331146Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.331146Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:6f5d87118ae2874b1dbdb34abb5f5e01badfca6a4b67b353e002b65ac270c69b","observation_id":"69e3e842-0aee-4b68-84a8-fc92d0a0facb","resolution":{"observed_at":"2026-08-04T12:50:14.331146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.343788Z","title":"How to evaluate reward models for rlhf,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.343788Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:20b78d0927aef0f594320180f51a9d875f8ac1f8111590a904c50a1cd3c814ed","observation_id":"49e62bec-280d-41f1-98dd-239663fcc6e5","resolution":{"observed_at":"2026-08-04T12:50:14.343788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.349540Z","title":"Rag- rewardbench: Benchmarking reward models in retrieval augmented generation for preference alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.349540Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7e2ea40023c198d425a9b7ddcde23857a442ed3daf1524b42566c0b7b71bcb83","observation_id":"f519490e-5159-4253-a35f-fc5254805e0c","resolution":{"observed_at":"2026-08-04T12:50:14.349540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.355432Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.355432Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:5745bf8108731b928a4ea7ff48782b441ad6fa850793f3ccc3fc1547c63da94e","observation_id":"947b5bbd-023e-4e6a-bb0f-571c89f963fe","resolution":{"observed_at":"2026-08-04T12:50:14.355432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.361135Z","title":"M- rewardbench: Evaluating reward models in multilingual settings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.361135Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7eb9825f2715959785b0b73dc2f009d783edea0b849d84e91b3b28fe9c9eef30","observation_id":"ce2ecd00-6516-4a46-83ef-2014b44a5746","resolution":{"observed_at":"2026-08-04T12:50:14.361135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.366222Z","title":"Rewardbench 2: Advancing reward model evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.366222Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:39f24b86e1cf8f787943d898c57c20226ece6794a78b7f27bc0da4661504d857","observation_id":"59035598-8f65-40ed-8ee0-8dd85b69ceaf","resolution":{"observed_at":"2026-08-04T12:50:14.366222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.371160Z","title":"Rewardanything: Generalizable principle- following reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.371160Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:09975794170c069b9b4d30becb8086640ed8580001d133337535cfce08dd89e4","observation_id":"d86c766f-4462-41ee-88f6-e5818aa20c5b","resolution":{"observed_at":"2026-08-04T12:50:14.371160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.375511Z","title":"Posterior-grpo: Rewarding reasoning processes in code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.375511Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:7d3b34a6076cf65bf40a35e1679c96a206afcbf279491280714e97db848950a1","observation_id":"f59b2732-3139-456d-be03-f4a8ca5154e8","resolution":{"observed_at":"2026-08-04T12:50:14.375511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.380163Z","title":"Processbench: Identifying process errors in mathematical reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.380163Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:8beb7771f7dd19823b4d3ad4b4f4d99bb456335f5ad45e1fad70998e4cbcef3a","observation_id":"98ac61df-440a-452c-8999-ddd09b4dab47","resolution":{"observed_at":"2026-08-04T12:50:14.380163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.385123Z","title":"Aurora:automated training framework of universal process reward models via ensemble prompting and reverse verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.385123Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:d01196e7fc43ceedf184248d56d9517274234765800297a41c739f3a3409f8ec","observation_id":"8eb11bf9-b177-4287-a981-1183e182a6c9","resolution":{"observed_at":"2026-08-04T12:50:14.385123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.390411Z","title":"Prmbench: A fine- grained and challenging benchmark for process-level reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.390411Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:aad894516fbaa252d5cc73bb9784362360f445b41ea07a899be2f804f998487b","observation_id":"6c6025d9-fb2c-45f5-99ab-8bc11df2feb9","resolution":{"observed_at":"2026-08-04T12:50:14.390411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.395864Z","title":"Evaluating judges as evaluators: The jetts benchmark of llm-as-judges as test-time scaling evaluators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.395864Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:ff348a187b79f531f2224777f2502e8c4dd051263632cee993e1c91c5d6507cb","observation_id":"9ce7865c-1af6-446e-9b99-b647bb8ddda7","resolution":{"observed_at":"2026-08-04T12:50:14.395864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.401123Z","title":"Mr-gsm8k: A meta- reasoning benchmark for large language model evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.401123Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:8792ad42e8ff1c445f0e0052b337765a6994115cae2059b358e8027a5f319d04","observation_id":"139f522b-18ca-479b-bc79-008624b82976","resolution":{"observed_at":"2026-08-04T12:50:14.401123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.406644Z","title":"Mr-ben: A meta-reasoning benchmark for evaluating system-2 thinking in llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.406644Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:69a07f0b52a68c5deeaf4822a2335a90ecf40964734ba4532ef6bcd313bf2da8","observation_id":"57c68f92-6f8d-45c0-a2fa-1c2e9f7f9151","resolution":{"observed_at":"2026-08-04T12:50:14.406644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.412524Z","title":"Vlrewardbench: A challenging benchmark for vision-language generative reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.412524Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:371357db37b3072fe7b78a281c4dffffad40f2c31e58777bbc96a7cec0d45072","observation_id":"afe1e143-9782-46d8-aded-3038aa86de8a","resolution":{"observed_at":"2026-08-04T12:50:14.412524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.418132Z","title":"Mj-bench: Is your multimodal reward model really a good judge for text-to-image generation?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.418132Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:1421f690ab7e9fee2ac5b53b72060173007f9cc4208553fdac9acbfe4d278e32","observation_id":"c61418bc-de68-446b-ac3b-90b3fccaddfe","resolution":{"observed_at":"2026-08-04T12:50:14.418132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.427592Z","title":"Multimodal rewardbench: Holistic evaluation of reward models for vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.427592Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:555a30ebcefa8a357a4d7c1e42fdd4f83921b767f0918f6cb68ef0a21bae54f9","observation_id":"12422c0f-c1ef-42dd-80c1-1f91e349b1f4","resolution":{"observed_at":"2026-08-04T12:50:14.427592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.434641Z","title":"Vlrmbench: A comprehensive and challenging benchmark for vision-language reward models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.434641Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:2bf5611b63d5c58d64c0756b9fc5fc83925df0f322a9ccc758f39dec6c026845","observation_id":"86227700-cb26-42e2-b957-94a3b60b3d8d","resolution":{"observed_at":"2026-08-04T12:50:14.434641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.441167Z","title":"Large language monkeys: Scaling inference compute with repeated sampling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.441167Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:c092bad96a3d93e53818b889996f802f65bbb5a08e70ba47e14a78660d046535","observation_id":"278fd8a1-8180-483e-b0cb-8e983c23cd0c","resolution":{"observed_at":"2026-08-04T12:50:14.441167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.448648Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.448648Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:f1ce14c43c6ec984a877cf568df3c6e44d210ac8a9773d8947087fba983f6c8e","observation_id":"6b17e9bf-f2fa-452b-969d-454cf3da10cd","resolution":{"observed_at":"2026-08-04T12:50:14.448648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:50:14.455925Z","title":"Sample, don’t search: Rethinking test-time alignment for language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T12:50:14.455925Z"},"links":{"citing_paper":"/paper/2510.01925"},"observation_digest":"sha256:d005ffe5bec22b0cf5562f7c5540ab93607ef5a7929af7e9243682dd341ec876","observation_id":"7529c14e-8412-4d55-b2c0-4501c2f7866d","resolution":{"observed_at":"2026-08-04T12:50:14.455925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01925","last_updated":"2026-08-03T11:37:46Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T11:40:36.606937Z","submitted_at":"2025-10-02T11:42:17Z","title":"Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":237},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 237 outbound references and 2 inbound Pith citation observations for arXiv:2510.01925."}