{"as_of":"2026-08-07T11:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2f75620544070690a743d2ad9dda90ef65ad4d66992a3c1d5a5fb7dcb4a6574","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:37:24.974376Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15512/citation-record","integrity":"/paper/2507.15512/integrity","json":"/paper/2507.15512/citation-record.json","paper":"/paper/2507.15512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.848566Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.848566Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:acb11b06c2714fbfdb1998a0237fe02eb827b27e566df9c5b2ed66346284c566","observation_id":"3fb0fe32-d866-4d42-a53a-1af59abac6f5","resolution":{"observed_at":"2026-08-06T15:37:24.848566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.853986Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.853986Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:986e8fe62e0558701f529bc1a091c49e451a8eb299724d5c664ed1e60e81f9c2","observation_id":"1e472068-85f0-41fa-85f2-924d6c0ea33c","resolution":{"observed_at":"2026-08-06T15:37:24.853986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.856899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.856899Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:c015b7ed91b1a31449178c683dffc2685b82486a4b39c59ca4b2ea753fc4722c","observation_id":"06ed4b1f-d4ed-4cc3-b07b-41f36c918a98","resolution":{"observed_at":"2026-08-06T15:37:24.856899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T15:37:24.860769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.860769Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:4dfbf5d85029adfbf6259a6c419d6e25238eebb75d1ef6f8cd759a16ba2e95bd","observation_id":"00d2d16e-e232-4f97-b42b-9ff633586a45","resolution":{"observed_at":"2026-08-06T15:37:24.860769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01077","last_updated":"2024-12-02T08:47:24Z","snapshot_observed_at":"2026-07-06T17:53:55.825572Z","submitted_at":"2024-04-01T12:19:08Z","title":"Efficient Prompting Methods for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01077","snapshot_observed_at":"2026-08-06T15:37:24.863525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.863525Z"},"links":{"cited_paper":"/paper/2404.01077","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:df638afac0abb3e79752eb3c50bfe30c18d3de8eaef818d7dc056205841bbcc1","observation_id":"0888cbf8-91aa-4517-a4cf-70e55c111605","resolution":{"observed_at":"2026-08-06T15:37:24.863525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-06T15:37:24.865956Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.865956Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:a1fa19eb12f8dd0bb5b4e6b41ec5087ff07fb6bb51d13af8e2514051925c542a","observation_id":"fec87c8d-ba97-4723-9c28-e1dca317d7b0","resolution":{"observed_at":"2026-08-06T15:37:24.865956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:37:24.869021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.869021Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:fff07ff856c7f0f6afa17db8405793de77e448b4849cbd15c0ea32425bb3dd7b","observation_id":"387a8b27-0780-4018-8b0b-d7d4ae9d039c","resolution":{"observed_at":"2026-08-06T15:37:24.869021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:37:24.872325Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.872325Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6f731faaf0e022284089c50f0773410be28362b41213e274bf6f7b5ba32185b6","observation_id":"cf468863-344c-42fa-8c3d-fbdcf602386d","resolution":{"observed_at":"2026-08-06T15:37:24.872325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16235","last_updated":"2025-02-27T06:39:06Z","snapshot_observed_at":"2026-07-06T20:41:01.690687Z","submitted_at":"2025-02-22T14:13:37Z","title":"Dynamic Parallel Tree Search for Efficient LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16235","snapshot_observed_at":"2026-08-06T15:37:24.874870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.874870Z"},"links":{"cited_paper":"/paper/2502.16235","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:f4897cbb9b9594afb120dfa834073da47ee6feda80656a72f8b572fef250adff","observation_id":"bf547cc7-471a-431c-a0fa-dd6c01112d2b","resolution":{"observed_at":"2026-08-06T15:37:24.874870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.284899Z","title":null,"venue":null,"work_id":"95474d55-30ed-4d57-8fc2-43a58c48cace","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.877196Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:4ce5d7c6548987ec27395638fe942f1ddea2f253125ff78a11654f4871cde16b","observation_id":"b919a394-ae99-48ee-a1d0-fda14ca763de","resolution":{"observed_at":"2026-08-06T15:37:25.287141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-06T15:37:24.879489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.879489Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:267de5d73564dea557522ae7cc3b46b363ca851dbe62c5e42997228c7a9e6c72","observation_id":"79fffff3-dc27-4602-9fb6-b8e1030a7516","resolution":{"observed_at":"2026-08-06T15:37:24.879489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:37:24.882178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.882178Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:122275466af56e3c9da52518da1349de883920758d30b42f6197fc194db88850","observation_id":"8794fd29-cfe3-42de-8b6e-43d1c798a70c","resolution":{"observed_at":"2026-08-06T15:37:24.882178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T15:37:24.884204Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.884204Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:edfb9ff26bd726120b40ea654be7934fd8db4d4c40993c0799ed06431d423e83","observation_id":"fd5cbf11-bbb8-4adf-9c00-05a41dab1f82","resolution":{"observed_at":"2026-08-06T15:37:24.884204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.278372Z","title":null,"venue":null,"work_id":"9206ffd1-406d-4eeb-9648-f0d70b77769d","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.886512Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0b70d2abaf1c8d1ac8a3a3882cce3d66f4a6b1037097b003e8652f60ee3b957a","observation_id":"270f58dd-1586-44d9-b353-99dc74c54396","resolution":{"observed_at":"2026-08-06T15:37:25.280708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-07-06T20:16:44.607678Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-08-06T15:37:24.888836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.888836Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:bb652eef079dbf4f7bd454329ca7be6d6045d2c9de7d0ade9234e5c1c690fac5","observation_id":"32281b08-23e6-4e8c-8a35-9f3f0d922fae","resolution":{"observed_at":"2026-08-06T15:37:24.888836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16265","last_updated":"2024-06-26T14:01:15Z","snapshot_observed_at":"2026-08-01T16:15:24.164308Z","submitted_at":"2024-05-25T15:07:33Z","title":"MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16265","snapshot_observed_at":"2026-08-06T15:37:24.891071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.891071Z"},"links":{"cited_paper":"/paper/2405.16265","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:c62c0750686f427e1b2035a04d8e4a9a94694e7cefd03ed3c39f731dce3e2fc1","observation_id":"1f219167-10ac-4d6a-82cf-37dfdece25e0","resolution":{"observed_at":"2026-08-06T15:37:24.891071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T15:37:24.893285Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.893285Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:ca71afbaa5058ea90a5d286cebf37f69d5a80d0ebd75ee8ce7f942e19bf650a9","observation_id":"122bc742-36ce-4876-a508-ca2ceaf498f3","resolution":{"observed_at":"2026-08-06T15:37:24.893285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.895591Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.895591Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:da0e14d8e312c2ff8d282bc487e26cc5d62b05c1e9c65e9a2b194bdc5368b137","observation_id":"cd30e8d6-b71f-4d93-9b37-cce2ecf9e573","resolution":{"observed_at":"2026-08-06T15:37:24.895591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T15:37:24.897708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.897708Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:4ee22b711618a7a57eb479ab61ce84501d0fe5592db764f52ec7578682b32951","observation_id":"25fa7974-b8ca-4780-b4e5-9fc7d7d2fc39","resolution":{"observed_at":"2026-08-06T15:37:24.897708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.900251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.900251Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:386cf7243f8a83dd74da4c191dad20da733f44ac2f8c761eb066eb7fa0ab0661","observation_id":"93694884-1d37-48aa-9d6c-fe9a1fb6f47f","resolution":{"observed_at":"2026-08-06T15:37:24.900251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.264136Z","title":null,"venue":null,"work_id":"12c11958-c88c-4b51-9dcb-8905e3f4582b","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.902306Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:905493c0b63fe506d1cee91462dac7eab52d502c873e17eb5367097b6338bf7b","observation_id":"94a41992-67de-4659-88cf-986d501d1dac","resolution":{"observed_at":"2026-08-06T15:37:25.266832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.257820Z","title":null,"venue":null,"work_id":"cd7b190e-89ef-49f6-9bd8-3327e68b97bb","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.904368Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:b7a821a4d85fb4cb73b40e1c1dc3fd84262b86d4a90ff815966e4adfe4fbc75f","observation_id":"7d89afc0-0d57-4e87-8861-e1e16611743d","resolution":{"observed_at":"2026-08-06T15:37:25.259854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.251198Z","title":null,"venue":null,"work_id":"9e52ee13-e14b-4d82-922a-3db7a121d51c","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.906307Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:85f8a3700210ca2fdbf53079e451fbb159774aa27247cbc190d48314e59c176b","observation_id":"0dc4419a-3029-4923-8ceb-d323da4ce8fe","resolution":{"observed_at":"2026-08-06T15:37:25.253476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.244561Z","title":null,"venue":null,"work_id":"0ba294b1-969b-49fd-a515-fd644f44cef5","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.908421Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:7c87b14a9ae34fb076130f45a6479a5b3c07e5eff9500a80613c7d284fc2167a","observation_id":"8f289958-4208-4114-9432-419e4611a362","resolution":{"observed_at":"2026-08-06T15:37:25.246885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:37:24.910293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.910293Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:0ffe3cffe88b9e81037b5e2a7a3e4e19cc956c2bda1ea7cf5837594e58959615","observation_id":"af9f2b31-e30b-4a7a-8262-590c58eb3025","resolution":{"observed_at":"2026-08-06T15:37:24.910293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.238628Z","title":null,"venue":null,"work_id":"00ce604d-9bda-4953-8344-96505cbc2125","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.912448Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:2ca906de88f8fb755b614692011608bd1a370ce97fa456dd634c309efa325ef7","observation_id":"de22a193-3e29-4776-8967-80c4c52146bb","resolution":{"observed_at":"2026-08-06T15:37:25.240689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.231445Z","title":null,"venue":null,"work_id":"63bf6e3b-efb1-4fad-ac28-a6d1d6e04f1a","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.914826Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:a3e6473eac549dc6a1950a77c5fb92d1f761a0141959292dc7b9024ffd1631e3","observation_id":"54efe568-fdcf-4759-b2bb-ba8298b473d7","resolution":{"observed_at":"2026-08-06T15:37:25.233762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15645","last_updated":"2025-06-01T08:26:17Z","snapshot_observed_at":"2026-08-05T19:10:42.512876Z","submitted_at":"2024-11-23T20:31:58Z","title":"MC-NEST: Enhancing Mathematical Reasoning in Large Language Models leveraging a Monte Carlo Self-Refine Tree","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15645","snapshot_observed_at":"2026-08-06T15:37:24.916693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.916693Z"},"links":{"cited_paper":"/paper/2411.15645","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6203b0cbe680f59c3f4bfdec58df0ab1ec80e790e02858308d4dc33de491ac12","observation_id":"3d9c8bdf-a42b-4db3-b90f-a95684e72fd2","resolution":{"observed_at":"2026-08-06T15:37:24.916693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.919131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.919131Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:72668a3e161430ac357207fa032c718cef446cdaba8018036359da864b66461a","observation_id":"ded48cee-0d04-43ff-beca-400b55807270","resolution":{"observed_at":"2026-08-06T15:37:24.919131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.221661Z","title":null,"venue":null,"work_id":"60d9eec2-789c-4ea6-a740-407d8e8a2987","year":2020},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.921365Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6177149330223ab32ecd879f39f4cfc5be50a5fe69cc67884a5e7a6c3d634683","observation_id":"8fc70004-692f-4544-9468-1df91cef1faf","resolution":{"observed_at":"2026-08-06T15:37:25.223708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:37:24.923893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.923893Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:3cba94fb6622e4487095424c6658aa6e5a53e8e6808c1e427a3b097e7c0c1b92","observation_id":"56eda410-0fa7-473f-936f-6e655336c53b","resolution":{"observed_at":"2026-08-06T15:37:24.923893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T15:37:24.925962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.925962Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e090e8589486fb72a71ba4c5822fa97151a7309b3cf08d7cdbc7acf36dec5511","observation_id":"255745b6-cfa4-4de7-8ab4-231be8d982ba","resolution":{"observed_at":"2026-08-06T15:37:24.925962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-07T08:05:38.374743Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-06T15:37:24.928392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.928392Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:d05db23c06d939910424313ca04a7b08cc27ec6c52e241fd97b12533eef3f6bb","observation_id":"cf571c63-c71a-4caa-946a-eea22154689b","resolution":{"observed_at":"2026-08-06T15:37:24.928392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T15:37:24.930558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.930558Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:604ddcf8f1bf026ce19d1437b3e2fea7e84608fce65e56d2dbd60b6c457d3153","observation_id":"31c72ada-d685-449e-8af8-0f8c0db39c97","resolution":{"observed_at":"2026-08-06T15:37:24.930558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T15:37:24.932824Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.932824Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:31dd4d6907f5149e107f33143adc4cada43384ed0eec61c5ec6405d36a4baae6","observation_id":"942872f9-e760-4cfb-8a5f-5c709f276273","resolution":{"observed_at":"2026-08-06T15:37:24.932824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.215410Z","title":null,"venue":null,"work_id":"0c548533-5d81-45db-9017-383a01386aec","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.934824Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:28afc8f8e0bfdc9bc93700fd167a52682543c8f3a46d1497dae3dcd72267bc0f","observation_id":"fe7517a8-eff5-442b-81c5-822196e81a48","resolution":{"observed_at":"2026-08-06T15:37:25.217484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-04T14:33:36.204296Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-06T15:37:24.936924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.936924Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:46dfc57976e6122b08b057b85e85f929eb666f5dc310a4f717bcbb3d0926ad06","observation_id":"3ea2de8a-6282-446c-b3c8-dcb133f67084","resolution":{"observed_at":"2026-08-06T15:37:24.936924Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T15:37:24.939339Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.939339Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:159796f1acfbb4ace9c8a8b9edcedd28d550d465bf0407c51e921bb403a6bf28","observation_id":"c1d1a203-5b25-4b88-83ee-0776460c306d","resolution":{"observed_at":"2026-08-06T15:37:24.939339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.209059Z","title":"Le, Ed H","venue":null,"work_id":"7225664b-6c5b-4bd4-99f5-238c847900b6","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.941418Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:3efb95fd41fcc4050f542f35e5bc535ba9a629d5b81d020a3dbf55aa05954867","observation_id":"15a8f3ad-d36f-491d-b35c-69e2c695b8dd","resolution":{"observed_at":"2026-08-06T15:37:25.211239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:24.943275Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.943275Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:a20b01026a777a3142f16b5a61f6ef457bad3b30e43acb51b8265cbc08d1bc1a","observation_id":"01f4e93f-2cbf-4427-8840-5990a60af7c4","resolution":{"observed_at":"2026-08-06T15:37:24.943275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T15:37:24.945481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.945481Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:2847b9e18997114da1ea46ef34b719174c3a51d8da7e6dae5c99e85f6956c06c","observation_id":"079a00e7-b7f0-40a1-8453-95ada4905eb1","resolution":{"observed_at":"2026-08-06T15:37:24.945481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.198060Z","title":null,"venue":null,"work_id":"e3215772-d739-4ef8-9434-2fee8cafe568","year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.947418Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:5a9ee30e726af03e481869fce6cd4390a0f7fdaaf8c16458c7281f265674a743","observation_id":"888b3b45-63a5-4bf8-a25e-c57afb5d0ea5","resolution":{"observed_at":"2026-08-06T15:37:25.200649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09223","last_updated":"2025-06-15T13:24:11Z","snapshot_observed_at":"2026-07-06T20:21:46.651618Z","submitted_at":"2025-01-16T01:03:56Z","title":"Foundations of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09223","snapshot_observed_at":"2026-08-06T15:37:24.949552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.949552Z"},"links":{"cited_paper":"/paper/2501.09223","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e8f25e608fca7254fa9e89d837110871fec831a98cba119aab98355bb00f0a44","observation_id":"47daccca-fc97-4a3f-a989-a7a8b31a624a","resolution":{"observed_at":"2026-08-06T15:37:24.949552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T15:37:24.951647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.951647Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:51ae5692da6ba7c2916864f12f09ba3ae0d218615ba36b57310a87058ad7fdb7","observation_id":"663df73f-68df-4176-9922-391a9287f81a","resolution":{"observed_at":"2026-08-06T15:37:24.951647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.191927Z","title":null,"venue":null,"work_id":"7e6a765d-fd73-46c2-aa7b-bdcc33ad46d1","year":2023},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.953990Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:db3b9c60e3fa8962ba615dd583b6ea70320f66f16817e2d267c54ec45ff821c6","observation_id":"a27e4034-1814-4d89-afa5-11b468fa5a14","resolution":{"observed_at":"2026-08-06T15:37:25.193983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T15:37:24.955844Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.955844Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:ef97a7fca7ee274c953bb4b109f9881882ab2f746caacb4df3d0d94a2a85f258","observation_id":"40a8dd28-cd25-4b90-86d0-9a9856adc807","resolution":{"observed_at":"2026-08-06T15:37:24.955844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-06T15:37:24.957990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.957990Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:157d795504588451611389db8b45995374543ad95fc62e51f6d8c640a90b259c","observation_id":"a1ecf1ba-7fac-4019-a561-0bda22fb1dce","resolution":{"observed_at":"2026-08-06T15:37:24.957990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.185604Z","title":null,"venue":null,"work_id":"073a68f8-70ee-42fc-a127-7f2bc2dc06a3","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.960189Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:8c64c7b95b35171329d51cd4c87880dd7761c752ca5b43cc0284cd736e92457f","observation_id":"98a9c10f-eba1-46ef-b98e-3ff54639620e","resolution":{"observed_at":"2026-08-06T15:37:25.187756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:37:25.178190Z","title":null,"venue":null,"work_id":"1095546b-f716-477a-bb79-34a4035d4dc8","year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.962130Z"},"links":{"citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:357b412dcbfd5e1edecded142b112b63aebde240f71ae429213c431c737d790a","observation_id":"1bfd7f65-1aeb-45a8-a77f-4127ea42aed0","resolution":{"observed_at":"2026-08-06T15:37:25.181254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-06T15:37:24.964766Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.964766Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:f6c1c4050092b76a19d86adb90f6cd7042da52b301c26ee1d6f75ec041aeaf60","observation_id":"109efe03-ab17-4f2a-b832-038edf186e46","resolution":{"observed_at":"2026-08-06T15:37:24.964766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17140","last_updated":"2024-06-06T03:59:24Z","snapshot_observed_at":"2026-07-06T18:05:55.328415Z","submitted_at":"2024-04-26T03:41:28Z","title":"Small Language Models Need Strong Verifiers to Self-Correct Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17140","snapshot_observed_at":"2026-08-06T15:37:24.967055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.967055Z"},"links":{"cited_paper":"/paper/2404.17140","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:c19dead9d85d805eb9a389a195e2677b830390f012db1300e1fdc6cfc008191c","observation_id":"8f21145a-2da8-4827-b183-28c5bb86f8d7","resolution":{"observed_at":"2026-08-06T15:37:24.967055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-06T15:37:24.969856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.969856Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:3e79767cbce7e39b0cf6bfee7d9058ecf699c35b6f46658fafe46862e127c272","observation_id":"d07800da-c014-48f5-a681-d6d9f3143dd2","resolution":{"observed_at":"2026-08-06T15:37:24.969856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14405","last_updated":"2024-11-25T17:57:55Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:37:33Z","title":"Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14405","snapshot_observed_at":"2026-08-06T15:37:24.972019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.972019Z"},"links":{"cited_paper":"/paper/2411.14405","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:6551fe8b898e84b99d5409ede1400be779e5c729a82ece56f00590ee6e80fd1e","observation_id":"afad08a3-61b1-4782-8c08-1af9a7c37026","resolution":{"observed_at":"2026-08-06T15:37:24.972019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-07-06T21:28:01.596548Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-08-06T15:37:24.974376Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:37:24.974376Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2507.15512"},"observation_digest":"sha256:e13e5a356a67855b14ccf0df25f75834c5ba21b6c2026f7c7259e7fb06c6233d","observation_id":"cb2dd002-b98d-4d15-a457-1b9382094597","resolution":{"observed_at":"2026-08-06T15:37:24.974376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15512","last_updated":"2025-09-09T08:04:09Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T15:27:54.651367Z","submitted_at":"2025-07-21T11:28:09Z","title":"Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.15512."}